漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-23 talkingdev

SWE-Bench Pro V2重磅发布:GPT-5与Claude Opus 4.1得分仅约23%,代码能力评测难度陡增

SWE-Bench Pro V2基准正式发布,共包含来自11个代码仓库的642项任务。该版本修正了此前任务中的错误,并优化了评估流程,使评测更贴近真实软件工程场景。结果显示,AI模型在该基准上的得分普遍下降,OpenAI GPT-5与C...

Read More