漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-04 talkingdev

OpenAI GPT-6 Astra 在 ARC-AGI-3 登顶:标准测试 62.7%,适配器模式 99.9% 创 SOTA

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准上取得了最新领先成绩。在标准测试条件下,该模型在半私有评估集上获得 62.7% 的得分,已达到当前最优水平;而在使用 provider adapter 适配器的测试框架中,成绩进一步提升...

Read More
2026-08-20 talkingdev

开源|Munder Difflin:本地多智能体终端代理编排工具,打造“办公室”式AI协作环境

Munder Difflin 是一个本地运行的多智能体编排桌面应用,能够将多个终端代理命令行工具(terminal-agent CLIs)作为可自我协调的智能实体进行统一管理。其核心架构由名为 Michael 的中央监督代理负责调度与协调,使...

Read More
2026-08-06 talkingdev

谷歌AI进入新篇章:Gemini模型势头强劲,DeepMind高层重组聚焦AGI

谷歌及其母公司Alphabet正在进行新一轮AI战略更新。首席执行官桑达尔·皮查伊分享了Gemini系列模型成功落地的信息,并指出用户在各类AI应用中的参与度正快速增长,显示出谷歌在生成式AI领域的布局已从技术储备转向大...

Read More
2026-08-06 talkingdev

Prime Agent开源亮相:自我改进的RLM代理在ARC-AGI-3上首超人类专家

Prime Agent是Prime Intellect发布的一款开源自我改进编码工具,其核心架构围绕递归语言模型(RLM)和持续训练框架(Continual Harness)两大抽象展开。该框架通过更优的上下文管理、多智能体协同与长期评估机制,赋...

Read More
2026-08-04 talkingdev

OpenAI未发布模型Astra破解十大开放数学难题,AI数学能力超越人类

OpenAI日前披露的未公开模型Astra一口气解决了数学界十个长期悬而未决的开放问题,再次刷新了人们对AI在高级推理领域潜力的认知。长期以来,数学一直是大型语言模型的软肋,人们习惯嘲笑AI连基础运算都频繁出错。然...

Read More
2026-08-02 talkingdev

数学界最高荣誉得主转战AI:Jacob Tsimerman加入OpenAI攻克AI安全难题

上周刚获得数学界最高荣誉菲尔兹奖的加拿大数学家Jacob Tsimerman,已从多伦多大学申请长期休假,转而加入OpenAI,专注于人工智能安全研究。这一动向不仅展现了基础科学前沿与AI产业的深度交融,也再次印证了AI安全...

Read More
2026-07-30 talkingdev

仅开启两项设置,OpenAI 在 ARC-AGI-3 基准上得分飙升三倍

OpenAI 最新披露,尽管其前沿模型 GPT-5.6 在数学领域解决了多个长期悬而未决的问题,并成功打通《宝可梦 火红》等复杂游戏,但在 ARC-AGI-3 基准测试中原始得分仅有 7.8%。这一巨大反差揭示了一个关键问题:基准测...

Read More
2026-06-15 talkingdev

开源|里约热内卢“自研”大模型被曝实为“拼接怪”:397B参数模型被指直接合并现有权重

近日,巴西里约热内卢市政府下属机构IplanRIO发布的“自研”大语言模型Rio-3.5-Open-397B陷入争议。GitHub社区及技术专家发现,该模型并非如其宣传所言“完全原创”,其权重实际上是通过对现有模型——Nex-AGI团队的Nex-N2...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page