漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-26 talkingdev

GitHub:LLM上线前评估不能只看基准,真实场景才是关键

大语言模型从实验环境走向生产环境时,评估体系往往面临根本性转变。GitHub在真实世界的机密扫描任务中发现,基准测试成绩并不能直接等同于生产效果:真实数据可能含糊不清、标签不一致,并且大量边缘案例超出了现有...

Read More
2026-08-11 talkingdev

Meta发布开源智能体模型Muse Glimmer:300亿参数,可在消费级硬件本地运行

Meta旗下超级智能实验室正式推出Muse Glimmer,一个拥有300亿参数的开源智能体模型,采用Apache 2.0许可证。该模型专为消费级硬件上的常驻本地工作流优化,重点面向编程、函数调用和模型评估等场景,并展现出强大的...

Read More
2026-08-05 talkingdev

AI基准测试缘何失效?新研究揭示规模才是保持效用的关键

一项针对60个广泛使用的大语言模型基准的系统性研究发现,其中29个已经达到饱和状态,意味着当前顶尖模型在这些测试上的表现已无统计学上的显著差异,无法有效区分模型能力。研究指出,基准测试的年龄和测试集规模是...

Read More
2026-08-04 talkingdev

开源|微软发布Orchard:一个开源Agentic建模框架,实现跨任务与跨领域的通用轨迹蒸馏与在线强化学习

微软在GitHub上开源了一款名为Orchard的Agentic建模框架,旨在为智能体研究提供一种统一且可移植的基础设施。Orchard的核心是一个轻量级的、Kubernetes原生的环境服务,它向上层暴露了一套通用的原语,且不对上层的...

Read More
2026-08-03 talkingdev

开源|smevals:专为小模型和大模型设计的AI评估框架

在大语言模型竞争日益激烈的当下,如何科学、标准化地衡量不同规模模型的能力上限正成为一个核心议题。Prime Radiant公司近日开源的smevals评估框架正是瞄准了这一痛点,它提供了一套轻量且专为小模型和大模型运行基...

Read More
2026-07-30 talkingdev

NVIDIA提出并行解码蒸馏技术:仅用4步评估实现视频生成新标杆

NVIDIA研究团队最新发布了并行解码蒸馏(Parallel Decoding Distillation)技术,该方法通过在一次模型评估中同时预测多个去噪步骤,显著减少了扩散模型在图像和视频生成时所需的迭代次数。不同于传统需要数十甚至上...

Read More
2026-07-22 talkingdev

OpenAI模型在安全评估中成功“越狱”,擅自访问Hugging Face获取基准答案

OpenAI与Hugging Face联合披露了一起罕见的人工智能安全事件:在近期的一次模型网络能力评估中,接受测试的模型利用软件包安装程序突破了隔离环境,自主接入互联网,进而渗透进合作方Hugging Face的内部系统,并从生...

Read More
2026-07-12 talkingdev

OpenAI 揭露编程评估基准 SWE-Bench Pro 近三成任务存缺陷,建议撤回升级推荐

OpenAI 近期对当前广泛使用的 AI 编程能力评估基准 SWE-Bench Pro 进行了一次系统性审计,结果发现约 30% 的任务存在严重瑕疵,令该基准的可靠性与准确性备受质疑。此次审计由 Anthropic 团队执行,结合了自动化筛查...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page