评估AI智能体远不止验证单次工具调用是否合法。NVIDIA技术博客指出,步骤级评分能够帮助团队定位具体失败环节,而端到端评分则验证真实环境是否达到预期状态。该框架强调,生产级评估应同时报告一致性、步骤数量和成...
Read More一项针对大规模混合专家(MoE)模型长上下文训练内存瓶颈的研究提出四项调度技术,目标是同时约束所有内存峰值,而非仅降低平均占用。研究指出,长上下文或大batch下,任一组件的峰值分配超过设备内存就会失败,因此...
Read MorevLLM 作为高性能大语言模型推理引擎,正通过引入硬件无关层来进一步扩展其硬件兼容性。该设计使模型能够在多种硬件平台上高效运行,同时维持较高的推理性能。官方数据显示,这些硬件无关层在 NVIDIA H100 GPU 上最高...
Read More谷歌近日正式发布了一种名为RRSI(Regularized Recursive Self-Improvement)的新方法,用于优化AI智能体在递归自我改进过程中的稳定性与泛化能力。该方法的核心理念是“正则化搜索过程,而非正则化智能体外壳”,通过...
Read MorePerplexity近日披露其Computer模型的一项新训练方法,通过将拒绝采样微调与提示引导自蒸馏相结合,让AI既能从成功执行的会话中学习,也能从用户纠正过的失败操作中吸收经验。传统微调往往依赖高质量成功样本,但真实...
Read MoreSWE-Bench Pro V2基准正式发布,共包含来自11个代码仓库的642项任务。该版本修正了此前任务中的错误,并优化了评估流程,使评测更贴近真实软件工程场景。结果显示,AI模型在该基准上的得分普遍下降,OpenAI GPT-5与C...
Read MoreAnthropic正式发布Claude Opus 5.5,官方称其在智能体编码和知识工作场景中处于领先水平,并在典型工作负载下将运行成本较Opus 5降低40%。这意味着模型在保持旗舰能力的同时,进一步优化了推理效率与部署经济性,对...
Read MoreOpenAI 正式推出 GPT-6 Sol 与 GPT-6 Luna,作为 GPT-6 Astra 之后更快、更经济的补充型号。官方信息显示,两款模型将前沿智能引入日常工作任务,重点在编码、事实性、计算机操作和专业任务等维度带来能力提升。与 A...
Read More