漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-23 talkingdev

AI Agent评估新范式:从工具调用到任务完成,NVIDIA给出生产级方法

评估AI智能体远不止验证单次工具调用是否合法。NVIDIA技术博客指出,步骤级评分能够帮助团队定位具体失败环节,而端到端评分则验证真实环境是否达到预期状态。该框架强调,生产级评估应同时报告一致性、步骤数量和成...

Read More
2026-09-23 talkingdev

论文推荐|固定GPU内存搞定大规模MoE长上下文训练:1M上下文吞吐最高提升10.4倍

一项针对大规模混合专家(MoE)模型长上下文训练内存瓶颈的研究提出四项调度技术,目标是同时约束所有内存峰值,而非仅降低平均占用。研究指出,长上下文或大batch下,任一组件的峰值分配超过设备内存就会失败,因此...

Read More
2026-09-23 talkingdev

vLLM 推出硬件无关模型层:在 H100 上实现 96.6% 原生效率

vLLM 作为高性能大语言模型推理引擎,正通过引入硬件无关层来进一步扩展其硬件兼容性。该设计使模型能够在多种硬件平台上高效运行,同时维持较高的推理性能。官方数据显示,这些硬件无关层在 NVIDIA H100 GPU 上最高...

Read More
2026-09-23 talkingdev

谷歌发布RRSI:让AI智能体递归自我改进更抗过拟合,分布外性能显著提升

谷歌近日正式发布了一种名为RRSI(Regularized Recursive Self-Improvement)的新方法,用于优化AI智能体在递归自我改进过程中的稳定性与泛化能力。该方法的核心理念是“正则化搜索过程,而非正则化智能体外壳”,通过...

Read More
2026-09-23 talkingdev

Perplexity革新AI训练:Computer模型从真实工具使用与用户纠错中学习

Perplexity近日披露其Computer模型的一项新训练方法,通过将拒绝采样微调与提示引导自蒸馏相结合,让AI既能从成功执行的会话中学习,也能从用户纠正过的失败操作中吸收经验。传统微调往往依赖高质量成功样本,但真实...

Read More
2026-09-23 talkingdev

SWE-Bench Pro V2重磅发布:GPT-5与Claude Opus 4.1得分仅约23%,代码能力评测难度陡增

SWE-Bench Pro V2基准正式发布,共包含来自11个代码仓库的642项任务。该版本修正了此前任务中的错误,并优化了评估流程,使评测更贴近真实软件工程场景。结果显示,AI模型在该基准上的得分普遍下降,OpenAI GPT-5与C...

Read More
2026-09-23 talkingdev

Anthropic发布Claude Opus 5.5:智能体编码与知识工作领先,运行成本降低40%

Anthropic正式发布Claude Opus 5.5,官方称其在智能体编码和知识工作场景中处于领先水平,并在典型工作负载下将运行成本较Opus 5降低40%。这意味着模型在保持旗舰能力的同时,进一步优化了推理效率与部署经济性,对...

Read More
2026-09-23 talkingdev

OpenAI 发布 GPT-6 Sol 与 Luna:更低成本的前沿智能进入日常工作

OpenAI 正式推出 GPT-6 Sol 与 GPT-6 Luna,作为 GPT-6 Astra 之后更快、更经济的补充型号。官方信息显示,两款模型将前沿智能引入日常工作任务,重点在编码、事实性、计算机操作和专业任务等维度带来能力提升。与 A...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page