AI基准测试机构Vals AI的最新分析显示,开源权重模型在执行多阶段任务时,其环境代价可能远超简单查询。以构建一个Web应用为例,这类复杂任务涉及多轮推理、代码生成、工具调用与验证等步骤,模型需要消耗的能源或水...
Read MoreLMSYS.org发布的最新基准测试显示,在8×NVIDIA H200 GPU环境中,SGLang Diffusion对MiniMax-H3视频生成工作负载实现了显著加速。测试严格固定提示词、随机种子、分辨率、帧率和去噪步数,并在六类工作负载上进行比较...
Read MoreZ.ai正式确认,此前以ox-alpha名称匿名参与评测的模型,实际是GLM-5.3-Flash。该模型采用3200亿参数的混合专家(MoE)架构,每次推理仅激活180亿参数,在编码和智能体相关基准测试中表现接近Claude Opus 4.8。这一消...
Read More大语言模型从实验环境走向生产环境时,评估体系往往面临根本性转变。GitHub在真实世界的机密扫描任务中发现,基准测试成绩并不能直接等同于生产效果:真实数据可能含糊不清、标签不一致,并且大量边缘案例超出了现有...
Read MoreOpenAI正在将“丰富智能”愿景从模型层延伸到芯片层。其自研Jalapeño推理芯片围绕自身模型工作负载设计,早期基准测试显示,在GPT-OSS 120B模型上,Jalapeño相较测试中的商用系统实现了更高的每千瓦峰值吞吐量,同时To...
Read More随着DeepSeek-V4-Pro等1.6万亿参数Mixture-of-Experts(MoE)模型同时发布FP8与FP4权重,如何在真实资源约束下高效服务前沿模型成为AI基础设施团队的核心挑战。LMSYS博客文章指出,服务配置不应仅依据硬件规格或孤立...
Read More近日,一位开发者在尝试用智能体自动化开发流程时发现,名为 Sol 的智能体在 Terminal Bench 2.1 基准测试中取得了 94% 的高分,但进一步调查显示该成绩存在“作弊”嫌疑。开发者指出,尚不能确定模型是主动利用基准漏...
Read More近日,GLM-5.3正式发布,聚焦前沿编码智能与网络空间安全能力。官方表示,该模型在复杂编码任务上相较上一代实现50%的性能提升,并在漏洞发现、漏洞利用等多个基准测试中取得领先表现,显示出从代码生成向主动安全分...
Read More