Real-SWE基准揭示大模型在真实生产代码库中的软肋:最佳配置仅解决38.8%任务
talkingdev • 2026-09-14
1530 views
Real-SWE是一个面向软件工程智能体的新基准,它与常见的HumanEval或SWE-bench不同,不依赖公开数据集中可能被模型记忆的题目,而是从经过许可的私有生产代码库中选取10项真实任务。这些任务包含大量企业业务规则和公司特有的编码约定,难以通过公开训练数据恢复。研究团队在640次rollouts中评估了多种模型与harness组合,结果显示表现最好的配置也只解决了38.8%的任务,且有6项任务的平均解决率低于15%。进一步分析表明,许多失败并非源于语法或简单逻辑错误,而是模型遗漏了需求,或基于未经验证的假设进行修改。这提醒业界,当前代码智能体在受控榜单上的高分,未必能直接转化为真实生产环境中的可靠交付能力。Real-SWE为衡量模型处理私有、复杂、强约束代码库的能力提供了更严格的参考。
核心要点
- Real-SWE从许可私有生产代码库中选取10项任务,包含难以从公开训练数据恢复的业务规则和公司约定。
- 在640次运行中,最佳配置仅解决38.8%的任务,6项任务平均解决率低于15%。
- 失败主因是遗漏需求或基于未验证假设,而非简单语法或逻辑错误。