OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上取得了最新领先成绩。在标准测试条件下,该模型在半私有评估集上获得 62.7% 的得分,已达到当前最优水平;而在使用 provider adapter 适配器的测试框架中,成绩进一步提升...
Read MoreMunder Difflin 是一个本地运行的多智能体编排桌面应用,能够将多个终端代理命令行工具(terminal-agent CLIs)作为可自我协调的智能实体进行统一管理。其核心架构由名为 Michael 的中央监督代理负责调度与协调,使...
Read More谷歌及其母公司Alphabet正在进行新一轮AI战略更新。首席执行官桑达尔·皮查伊分享了Gemini系列模型成功落地的信息,并指出用户在各类AI应用中的参与度正快速增长,显示出谷歌在生成式AI领域的布局已从技术储备转向大...
Read MorePrime Agent是Prime Intellect发布的一款开源自我改进编码工具,其核心架构围绕递归语言模型(RLM)和持续训练框架(Continual Harness)两大抽象展开。该框架通过更优的上下文管理、多智能体协同与长期评估机制,赋...
Read MoreOpenAI日前披露的未公开模型Astra一口气解决了数学界十个长期悬而未决的开放问题,再次刷新了人们对AI在高级推理领域潜力的认知。长期以来,数学一直是大型语言模型的软肋,人们习惯嘲笑AI连基础运算都频繁出错。然...
Read More上周刚获得数学界最高荣誉菲尔兹奖的加拿大数学家Jacob Tsimerman,已从多伦多大学申请长期休假,转而加入OpenAI,专注于人工智能安全研究。这一动向不仅展现了基础科学前沿与AI产业的深度交融,也再次印证了AI安全...
Read MoreOpenAI 最新披露,尽管其前沿模型 GPT-5.6 在数学领域解决了多个长期悬而未决的问题,并成功打通《宝可梦 火红》等复杂游戏,但在 ARC-AGI-3 基准测试中原始得分仅有 7.8%。这一巨大反差揭示了一个关键问题:基准测...
Read More近日,巴西里约热内卢市政府下属机构IplanRIO发布的“自研”大语言模型Rio-3.5-Open-397B陷入争议。GitHub社区及技术专家发现,该模型并非如其宣传所言“完全原创”,其权重实际上是通过对现有模型——Nex-AGI团队的Nex-N2...
Read More