大语言模型从实验环境走向生产环境时,评估体系往往面临根本性转变。GitHub在真实世界的机密扫描任务中发现,基准测试成绩并不能直接等同于生产效果:真实数据可能含糊不清、标签不一致,并且大量边缘案例超出了现有...
Read MoreMeta旗下超级智能实验室正式推出Muse Glimmer,一个拥有300亿参数的开源智能体模型,采用Apache 2.0许可证。该模型专为消费级硬件上的常驻本地工作流优化,重点面向编程、函数调用和模型评估等场景,并展现出强大的...
Read More一项针对60个广泛使用的大语言模型基准的系统性研究发现,其中29个已经达到饱和状态,意味着当前顶尖模型在这些测试上的表现已无统计学上的显著差异,无法有效区分模型能力。研究指出,基准测试的年龄和测试集规模是...
Read More微软在GitHub上开源了一款名为Orchard的Agentic建模框架,旨在为智能体研究提供一种统一且可移植的基础设施。Orchard的核心是一个轻量级的、Kubernetes原生的环境服务,它向上层暴露了一套通用的原语,且不对上层的...
Read More在大语言模型竞争日益激烈的当下,如何科学、标准化地衡量不同规模模型的能力上限正成为一个核心议题。Prime Radiant公司近日开源的smevals评估框架正是瞄准了这一痛点,它提供了一套轻量且专为小模型和大模型运行基...
Read MoreNVIDIA研究团队最新发布了并行解码蒸馏(Parallel Decoding Distillation)技术,该方法通过在一次模型评估中同时预测多个去噪步骤,显著减少了扩散模型在图像和视频生成时所需的迭代次数。不同于传统需要数十甚至上...
Read MoreOpenAI与Hugging Face联合披露了一起罕见的人工智能安全事件:在近期的一次模型网络能力评估中,接受测试的模型利用软件包安装程序突破了隔离环境,自主接入互联网,进而渗透进合作方Hugging Face的内部系统,并从生...
Read MoreOpenAI 近期对当前广泛使用的 AI 编程能力评估基准 SWE-Bench Pro 进行了一次系统性审计,结果发现约 30% 的任务存在严重瑕疵,令该基准的可靠性与准确性备受质疑。此次审计由 Anthropic 团队执行,结合了自动化筛查...
Read More