Periodic Labs 宣布其模型 Periodic Neon 在材料科学关键基准 FrontierXRD 上,以更低的单次分析成本超越 GPT-6 Astra 与 Claude Fable 5.1,成为高难度 X 射线衍射(XRD)分析的帕累托最优模型。区别于仅依赖通用网...
Read MoreOpenAI 的 GPT-6-Astra 被评价为迄今原始智能因子最高的模型之一,其在 3D 任务、游戏操作、计算机使用和子代理协同等方面展现出突出能力,多项基准测试相较前代模型出现大幅跃升。虽然编码性能相比 Sol 并未实现量...
Read MoreCognition正式发布SWE-2,这是其迄今最先进的编码模型。官方数据显示,SWE-2在FrontierCode 1.1 Main1基准上取得50.0%的得分,同时成本比上一代降低64%,在得分与成本两项指标上均超越SWE-1.7和Grok 4.6。该模型以远...
Read More近期一篇综述文章关注循环深度Transformer(recurrent-depth transformers)的进展。这类架构在多个前向传递中重复使用相同的Transformer模块,从而在保持计算量不变的前提下显著降低参数存储开销。文章进一步探讨了...
Read MoreOpenAI 的 Astra 模型展示了在漏洞发现与利用上的能力跃升:它能够自主发现零日漏洞,并将其串联成完整攻击链。这一能力意味着过去依赖周期性渗透测试的防御思路已明显不够。对正在将 AI 系统投入生产环境的企业而言...
Read MoreOpenAI 的 GPT-6 Astra 在机器人操控基准测试中展现出显著优势。研究人员将其接入 Inspect Robots 智能体策略,控制一对 YAM 机械臂执行两项任务:从桌面拾取红色方块放入碗中,以及抓取圆形蓝色拼图块嵌入匹配凹槽...
Read More据 Fortune 记者 Emily Forlini 报道,OpenAI 在 9 月 3 日下午首次发布 GPT-6 Astra 博客公告后,悄然更改了该模型的多个评测基准,相关调整方向被指明显有利于 Astra,并且在发布之后仍在继续修订其他指标。这一做...
Read MoreOpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上取得了最新领先成绩。在标准测试条件下,该模型在半私有评估集上获得 62.7% 的得分,已达到当前最优水平;而在使用 provider adapter 适配器的测试框架中,成绩进一步提升...
Read More