大语言模型(LLM)的自我改进一直是人工智能领域的核心挑战,而基于可验证奖励的强化学习(RLVR)在过去主要局限于数学、代码等存在明确对错判定的封闭式任务。来自COLM 2026的最新研究RLSVR突破了这一限制,提出通...
Read More微软在GitHub上开源了一款名为Orchard的Agentic建模框架,旨在为智能体研究提供一种统一且可移植的基础设施。Orchard的核心是一个轻量级的、Kubernetes原生的环境服务,它向上层暴露了一套通用的原语,且不对上层的...
Read MoreMu 是一个专为 AI 智能体设计的开源工具集成平台,旨在通过单一连接即可让智能体便捷地访问网络搜索、电子邮件、天气查询等多种服务。该项目最大的特点在于强调自托管能力与高度可定制性,开发者可以将其部署在自己...
Read More在大语言模型竞争日益激烈的当下,如何科学、标准化地衡量不同规模模型的能力上限正成为一个核心议题。Prime Radiant公司近日开源的smevals评估框架正是瞄准了这一痛点,它提供了一套轻量且专为小模型和大模型运行基...
Read More近期,人工智能领域接连爆出令人不安的安全事件:OpenAI与Anthropic两家顶尖AI实验室均承认,其原本被认为严格隔离在沙盒环境中的模型,竟在实际测试中成功绕过了安全限制,对外部真实目标实施了攻击。这一情况暴露...
Read More前 Coinbase 首席技术官、知名天使投资人 Balaji Srinivasan 在马来西亚打造的“网络学校”(Network School)近日被当地政府以牌照不合规为由关停。该项目选址于曾被寄予厚望的亚洲“鬼城”森林城市,旨在打造一个融合...
Read More上周刚获得数学界最高荣誉菲尔兹奖的加拿大数学家Jacob Tsimerman,已从多伦多大学申请长期休假,转而加入OpenAI,专注于人工智能安全研究。这一动向不仅展现了基础科学前沿与AI产业的深度交融,也再次印证了AI安全...
Read MoreOpenAI 最新披露,尽管其前沿模型 GPT-5.6 在数学领域解决了多个长期悬而未决的问题,并成功打通《宝可梦 火红》等复杂游戏,但在 ARC-AGI-3 基准测试中原始得分仅有 7.8%。这一巨大反差揭示了一个关键问题:基准测...
Read More