OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上取得了最新领先成绩。在标准测试条件下,该模型在半私有评估集上获得 62.7% 的得分,已达到当前最优水平;而在使用 provider adapter 适配器的测试框架中,成绩进一步提升...
Read More当人工智能能够自动化AI研发本身,世界会发生怎样的剧变?近期,红杉研究(Redwood Research)首席科学家瑞安·格林布拉特在一次深度访谈中探讨了递归式自我改进(RSI)这一当前AI领域最具争议的话题。他认为,一旦AI...
Read More在人工智能深度介入前沿科学研究的浪潮中,一场关于优先权的微妙竞赛悄然上演。据《科学美国人》报道,来自麻省理工学院的一名博士生与加州大学系统的两位密码学家,几乎在同一时间将顶级大模型GPT-5.6 Sol Ultra应...
Read MoreOpenAI正式推出GPT-5.6系列模型,包含Sol、Terra和Luna三个版本,其中Sol在编码、网络安全和科学研究等任务中展现出领先的智能与效率。该系列模型通过更少的令牌消耗实现更强的性能,单位算力成本显著下降。Sol在多...
Read More强化学习(RL)在可验证领域(如棋类游戏、编程代码)的成功已毋庸置疑,但现实世界中大量复杂任务(如机器人操控、制药分子设计、开放域对话)难以通过简单规则或自动脚本进行验证,这构成了RL落地的关键瓶颈。本文...
Read MoreOpenAI近期举办的一场名为“参数高尔夫”的竞赛吸引了超过1000名参与者和2000份提交作品。该竞赛的核心挑战是在严格约束条件下,尽可能减少数据集的损失。参赛者运用了多种先进技术,包括精细调参、量化以及新颖的建模...
Read More谷歌DeepMind团队近日发布了其最新成果AlphaEvolve,这是一个由Gemini大模型驱动的自主编码代理。与普通的代码助手不同,AlphaEvolve的核心能力在于设计并生成高级算法,而不仅仅是补全或改写现有代码。它已经能够在...
Read More在人工智能领域,众多团队宣称其研发的智能体具备卓越的科学发现能力,但支撑这些声明的证据往往难以令人信服。为客观评估AI在科学探索中的真实水平,艾伦人工智能研究所(AI2)开发并开源了两项关键基准测试:Scien...
Read More