漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-16 talkingdev

Periodic Neon 超越 GPT-6 Astra 与 Claude Fable 5.1:更低成本攻克高难 XRD 分析,已部署实验室加速超导体研发

Periodic Labs 宣布其模型 Periodic Neon 在材料科学关键基准 FrontierXRD 上,以更低的单次分析成本超越 GPT-6 Astra 与 Claude Fable 5.1,成为高难度 X 射线衍射(XRD)分析的帕累托最优模型。区别于仅依赖通用网...

Read More
2026-09-14 talkingdev

GPT-6-Astra 能力惊艳:3D、游戏与智能体协同全面跃升,OpenAI 已暗示更强模型将至

OpenAI 的 GPT-6-Astra 被评价为迄今原始智能因子最高的模型之一,其在 3D 任务、游戏操作、计算机使用和子代理协同等方面展现出突出能力,多项基准测试相较前代模型出现大幅跃升。虽然编码性能相比 Sol 并未实现量...

Read More
2026-09-11 talkingdev

Cognition发布SWE-2:编码性能逼近GPT-6 Astra,成本仅四分之一

Cognition正式发布SWE-2,这是其迄今最先进的编码模型。官方数据显示,SWE-2在FrontierCode 1.1 Main1基准上取得50.0%的得分,同时成本比上一代降低64%,在得分与成本两项指标上均超越SWE-1.7和Grok 4.6。该模型以远...

Read More
2026-09-10 talkingdev

GPT-6 Astra与循环Transformer:隐藏推理如何重塑大模型参数效率?

近期一篇综述文章关注循环深度Transformer(recurrent-depth transformers)的进展。这类架构在多个前向传递中重复使用相同的Transformer模块,从而在保持计算量不变的前提下显著降低参数存储开销。文章进一步探讨了...

Read More
2026-09-09 talkingdev

OpenAI Astra 敲响警钟:AI 自主发现并串联零日漏洞,安全团队如何接招?

OpenAI 的 Astra 模型展示了在漏洞发现与利用上的能力跃升:它能够自主发现零日漏洞,并将其串联成完整攻击链。这一能力意味着过去依赖周期性渗透测试的防御思路已明显不够。对正在将 AI 系统投入生产环境的企业而言...

Read More
2026-09-07 talkingdev

GPT-6 Astra机器人操控实测:方块入碗19/20远超Claude Fable,成本减半

OpenAI 的 GPT-6 Astra 在机器人操控基准测试中展现出显著优势。研究人员将其接入 Inspect Robots 智能体策略,控制一对 YAM 机械臂执行两项任务:从桌面拾取红色方块放入碗中,以及抓取圆形蓝色拼图块嵌入匹配凹槽...

Read More
2026-09-06 talkingdev

OpenAI 被曝悄悄更新 GPT-6 Astra 评测基准,多项指标被指偏袒自家模型且发布后仍持续修改

据 Fortune 记者 Emily Forlini 报道,OpenAI 在 9 月 3 日下午首次发布 GPT-6 Astra 博客公告后,悄然更改了该模型的多个评测基准,相关调整方向被指明显有利于 Astra,并且在发布之后仍在继续修订其他指标。这一做...

Read More
2026-09-04 talkingdev

OpenAI GPT-6 Astra 在 ARC-AGI-3 登顶:标准测试 62.7%,适配器模式 99.9% 创 SOTA

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上取得了最新领先成绩。在标准测试条件下,该模型在半私有评估集上获得 62.7% 的得分,已达到当前最优水平;而在使用 provider adapter 适配器的测试框架中,成绩进一步提升...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page