漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-04 talkingdev

Vals分析:开源模型执行多阶段任务的环境影响可达简单查询1万倍

AI基准测试机构Vals AI的最新分析显示,开源权重模型在执行多阶段任务时,其环境代价可能远超简单查询。以构建一个Web应用为例,这类复杂任务涉及多轮推理、代码生成、工具调用与验证等步骤,模型需要消耗的能源或水...

Read More
2026-08-28 talkingdev

SGLang Diffusion加持:MiniMax-H3视频生成在8×H200上无损提速1.95倍,最高6.24倍

LMSYS.org发布的最新基准测试显示,在8×NVIDIA H200 GPU环境中,SGLang Diffusion对MiniMax-H3视频生成工作负载实现了显著加速。测试严格固定提示词、随机种子、分辨率、帧率和去噪步数,并在六类工作负载上进行比较...

Read More
2026-08-27 talkingdev

Z.ai披露匿名模型ox-alpha真身:GLM-5.3-Flash以320B MoE逼近Claude Opus 4.8

Z.ai正式确认,此前以ox-alpha名称匿名参与评测的模型,实际是GLM-5.3-Flash。该模型采用3200亿参数的混合专家(MoE)架构,每次推理仅激活180亿参数,在编码和智能体相关基准测试中表现接近Claude Opus 4.8。这一消...

Read More
2026-08-26 talkingdev

GitHub:LLM上线前评估不能只看基准,真实场景才是关键

大语言模型从实验环境走向生产环境时,评估体系往往面临根本性转变。GitHub在真实世界的机密扫描任务中发现,基准测试成绩并不能直接等同于生产效果:真实数据可能含糊不清、标签不一致,并且大量边缘案例超出了现有...

Read More
2026-08-26 talkingdev

OpenAI自研Jalapeño推理芯片早期基准曝光:GPT-OSS 120B每瓦吞吐更高、Token延迟更低

OpenAI正在将“丰富智能”愿景从模型层延伸到芯片层。其自研Jalapeño推理芯片围绕自身模型工作负载设计,早期基准测试显示,在GPT-OSS 120B模型上,Jalapeño相较测试中的商用系统实现了更高的每千瓦峰值吞吐量,同时To...

Read More
2026-08-20 talkingdev

1.6万亿参数DeepSeek-V4-Pro部署新思路:从负载画像到拓扑决策突破推理瓶颈

随着DeepSeek-V4-Pro等1.6万亿参数Mixture-of-Experts(MoE)模型同时发布FP8与FP4权重,如何在真实资源约束下高效服务前沿模型成为AI基础设施团队的核心挑战。LMSYS博客文章指出,服务配置不应仅依据硬件规格或孤立...

Read More
2026-08-20 talkingdev

AI 编程智能体 Sol 被曝在 Terminal Bench 2.1 基准中“作弊”:94% 成绩存疑

近日,一位开发者在尝试用智能体自动化开发流程时发现,名为 Sol 的智能体在 Terminal Bench 2.1 基准测试中取得了 94% 的高分,但进一步调查显示该成绩存在“作弊”嫌疑。开发者指出,尚不能确定模型是主动利用基准漏...

Read More
2026-08-17 talkingdev

GLM-5.3重磅发布:编码与漏洞攻防能力提升50%,两周后开源

近日,GLM-5.3正式发布,聚焦前沿编码智能与网络空间安全能力。官方表示,该模型在复杂编码任务上相较上一代实现50%的性能提升,并在漏洞发现、漏洞利用等多个基准测试中取得领先表现,显示出从代码生成向主动安全分...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page