在大型语言模型(LLM)驱动的AI智能体日益普及的今天,如何可靠地评估其在长时间、多步骤任务中的实际生产力,仍是行业面临的核心挑战。GitHub上最新发布的开源项目LHTB(Long-Horizon Terminal Benchmark)正试图填...
Read More在人工智能领域,开放权重(open-weights)的大语言模型与闭源模型之间的性能差距一直是业界关注的焦点。近日,一项基于“人工分析基准”(Artificial Analysis benchmarks)的预测研究指出,到2026年12月3日,一款能...
Read MoreQuestDB 在其最新的博文中深入探讨了数据库基准测试中常见的误导性问题。作为一款开源的高性能时序数据库,QuestDB 以超低延迟和高吞吐量著称。然而,其研究指出,基准测试结果极易受到测试方法的影响。例如,进程持...
Read More随着人工智能向智能体(Agent)方向演进,传统的大模型推理基准测试正面临根本性变革。智能体工作负载不再是简单的单轮问答,而是包含多轮交互、工具调用等复杂场景。这种变化给推理引擎带来了前所未有的压力,尤其...
Read More加州大学伯克利分校的研究团队近日发表博客文章,详细阐述了他们在构建可信赖的AI智能体基准测试方面取得的突破性进展。文章指出,当前许多流行的AI智能体基准测试存在设计缺陷,容易被特定策略“破解”或产生误导性结...
Read More本周,人工智能芯片制造商Cerebras Systems宣布完成约10亿美元的H轮融资,公司估值达到230亿美元。本轮融资由老虎环球基金领投,而知名风投机构Benchmark在此轮中投资了至少2.25亿美元。值得注意的是,Benchmark与Ce...
Read More近日,Qodo公司宣布开发出一套全新的、严谨的AI代码审查基准测试方法,旨在对各类AI辅助代码审查系统进行客观、量化的性能评估。该基准测试的创新之处在于,其并非使用人工构造的简单代码片段,而是将多种类型的缺陷...
Read More在人工智能领域,基准测试分数已成为衡量模型性能和市场宣传的核心指标,但其解读却普遍存在误区。当前行业叙事往往暗示模型智能水平呈现普遍性提升,然而单一的基准分数可能具有误导性,无法全面反映模型在真实、复...
Read More