跳转到内容

测试集:SWE-bench Verified

来自封神榜 Wiki
名称 SWE-bench Verified
类别 coding
主办方 SWE-bench 团队(Princeton NLP)× OpenAI,2024-08 发布
开源状态 open
网址 官方页面

swe-bench-verified80真实 GitHub issue、人工筛选 500 题、跑测试判分、Agent 端到端修 bug、2026-02 官方弃用

测试集content/benchmarks/swe-bench-verified.md

一句话

给 AI 出真实 GitHub issue,让它把 bug 修好

测什么

从原版 SWE-bench 的 2294 个真实 GitHub issue 里,由人工筛出 500 个「确实能解、描述清楚」的任务,全部来自 django、scikit-learn、sympy、matplotlib、astropy 等 12 个成熟 Python 项目。它测的不是写片段代码,而是端到端的软件工程能力:agent 要读懂用户抱怨、在上万行的陌生代码库里定位病灶、写出不破坏其他功能的补丁。之所以要人工筛选,是因为原版里不少任务描述含糊或测试有问题,分数会失真。

怎么测

agent 拿到两样东西:一段用户写的 issue 描述,和 bug 被修复之前那一刻的完整仓库快照,然后自由探索、改代码,最后产出一个补丁文件。评测把补丁打进仓库跑两组测试:fail-to-pass 测试(原来失败、修好后必须通过的)确认 bug 真被修好,pass-to-pass 测试确认没把别的功能弄坏。全过才算 Resolved,报 % Resolved(pass@1,即一次出手就修好的比例)。

典型任务

以经典任务 astropy-14635 为例:用户报告天文数据库 astropy 的 QDP 文件读取器有个 bug——它错误地假设输入命令必须全是大写,导致「read serr 1 2」这样的小写命令直接崩溃,而 QDP 格式本身是不区分大小写的。agent 只拿到这段用户吐槽和整个 astropy 源码,要自己找到 QDP 解析模块、改成兼容大小写、且不影响其他读取逻辑。多数顶尖 agent 在这题上栽过跟头:要么补丁只处理了用户给的特例(过拟合),要么改动不完整、没覆盖边界情况。

分数怎么看

% Resolved 越高越好。它发布后的两年里是编程榜的绝对主角,头部模型分数一路冲到 80% 以上——但冲得越高越可疑:OpenAI 的审计发现,GPT-5.2、Claude Opus 4.5、Gemini 3 Flash 等前沿模型都能逐字背出部分题目的官方参考答案,高分里有多少是真本事已经说不清。

含金量与局限

OpenAI 已于 2026-02 宣布弃用并建议行业停用:审计 138 个难题发现 59.4% 存在实质缺陷——35.5% 的测试过窄、把功能正确但实现不同的解法误判为错,18.8% 的测试过宽、检查了题目根本没要求的功能;且所有受测前沿模型都存在训练数据污染。本站保留此条主要是历史定位,新项目建议看 SWE-bench Pro。

冷知识

最戏剧性的是「亲生父母亲手判死刑」:OpenAI 是 Verified 的联合出品方,两年后却自己发审计报告建议全行业停用它——受审的 138 个难题近六成有毛病,而且 GPT-5.2、Claude Opus 4.5 这些尖子生都能逐字默写参考答案,高分里有多少真本事已经说不清。

数据来源

本页由仓库 content/benchmarks/swe-bench-verified.md 初始化。后续修订通过公开审核队列发布。