漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-04 talkingdev

OpenAI GPT-6 Astra 在 ARC-AGI-3 登顶:标准测试 62.7%,适配器模式 99.9% 创 SOTA

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上取得了最新领先成绩。在标准测试条件下,该模型在半私有评估集上获得 62.7% 的得分,已达到当前最优水平;而在使用 provider adapter 适配器的测试框架中,成绩进一步提升...

Read More
2026-08-12 talkingdev

AI实现自我研究自动化后会发生什么?红杉研究首席科学家深度解读递归式自我改进

当人工智能能够自动化AI研发本身,世界会发生怎样的剧变?近期,红杉研究(Redwood Research)首席科学家瑞安·格林布拉特在一次深度访谈中探讨了递归式自我改进(RSI)这一当前AI领域最具争议的话题。他认为,一旦AI...

Read More
2026-08-03 talkingdev

两个独立团队同时用GPT-5.6 Sol Ultra攻克同一量子密码难题,论文提交仅差3小时,引爆科研优先权争议

在人工智能深度介入前沿科学研究的浪潮中,一场关于优先权的微妙竞赛悄然上演。据《科学美国人》报道,来自麻省理工学院的一名博士生与加州大学系统的两位密码学家,几乎在同一时间将顶级大模型GPT-5.6 Sol Ultra应...

Read More
2026-07-12 talkingdev

OpenAI发布GPT-5.6:Sol、Terra、Luna三大模型亮相,以更低成本实现前沿智能

OpenAI正式推出GPT-5.6系列模型,包含Sol、Terra和Luna三个版本,其中Sol在编码、网络安全和科学研究等任务中展现出领先的智能与效率。该系列模型通过更少的令牌消耗实现更强的性能,单位算力成本显著下降。Sol在多...

Read More
2026-06-30 talkingdev

强化学习突破“可验证”边界,下一波AI浪潮已至

强化学习(RL)在可验证领域(如棋类游戏、编程代码)的成功已毋庸置疑,但现实世界中大量复杂任务(如机器人操控、制药分子设计、开放域对话)难以通过简单规则或自动脚本进行验证,这构成了RL落地的关键瓶颈。本文...

Read More
2026-05-13 talkingdev

参数高尔夫竞赛揭示AI智能体在科研竞赛中的新角色

OpenAI近期举办的一场名为“参数高尔夫”的竞赛吸引了超过1000名参与者和2000份提交作品。该竞赛的核心挑战是在严格约束条件下,尽可能减少数据集的损失。参赛者运用了多种先进技术,包括精细调参、量化以及新颖的建模...

Read More
2026-05-08 talkingdev

AlphaEvolve:谷歌Gemini驱动的AI编码代理,正在多领域引发颠覆性突破

谷歌DeepMind团队近日发布了其最新成果AlphaEvolve,这是一个由Gemini大模型驱动的自主编码代理。与普通的代码助手不同,AlphaEvolve的核心能力在于设计并生成高级算法,而不仅仅是补全或改写现有代码。它已经能够在...

Read More
2026-04-16 talkingdev

AI科学发现能力大考:艾伦AI研究所新基准揭示,顶尖智能体仍难匹敌人类科学家

在人工智能领域,众多团队宣称其研发的智能体具备卓越的科学发现能力,但支撑这些声明的证据往往难以令人信服。为客观评估AI在科学探索中的真实水平,艾伦人工智能研究所(AI2)开发并开源了两项关键基准测试:Scien...

Read More
  1. Next Page