SWE-bench Verified 测试集档案
SWE-bench Verified 测试集中文档案:给 AI 出真实 GitHub issue,让它把 bug 修好 由 SWE-bench 团队(Princeton NLP)× OpenAI,2024-08 发布 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- SWE-bench Verified
- SWE-Bench Verified
- SWE-Verified
- SWE-bench Verified(初版/Code 版/前代实测/3.1 Pro 参考/OpenHands 100-turn)
- 独立 SWE-bench 评测
- SWE-bench 开源榜
- SWE-bench 系列
- SWE-bench Verified 编码榜
- SWE-bench 团队(Princeton NLP)× OpenAI,2024-08 发布
已发布事实
- 题量
- 500 个任务(人工筛自原版 2294 个 GitHub issue)
- 来源
- 12 个成熟 Python 仓库(django、sympy、scikit-learn、astropy 等)
- 发布
- 2024-08(原版 SWE-bench 为 2023-10)
- 计分
- % Resolved(pass@1):补丁跑 fail-to-pass + pass-to-pass 测试
- 数据
- 公开(HuggingFace: princeton-nlp/SWE-bench_Verified)
- 状态
- 2026-02 被 OpenAI 宣布弃用
它测什么
从原版 SWE-bench 的 2294 个真实 GitHub issue 里,由人工筛出 500 个「确实能解、描述清楚」的任务,全部来自 django、scikit-learn、sympy、matplotlib、astropy 等 12 个成熟 Python 项目。它测的不是写片段代码,而是端到端的软件工程能力:agent 要读懂用户抱怨、在上万行的陌生代码库里定位病灶、写出不破坏其他功能的补丁。之所以要人工筛选,是因为原版里不少任务描述含糊或测试有问题,分数会失真。
怎么测
agent 拿到两样东西:一段用户写的 issue 描述,和 bug 被修复之前那一刻的完整仓库快照,然后自由探索、改代码,最后产出一个补丁文件。评测把补丁打进仓库跑两组测试:fail-to-pass 测试(原来失败、修好后必须通过的)确认 bug 真被修好,pass-to-pass 测试确认没把别的功能弄坏。全过才算 Resolved,报 % Resolved(pass@1,即一次出手就修好的比例)。
分数怎么看
% Resolved 越高越好。它发布后的两年里是编程榜的绝对主角,头部模型分数一路冲到 80% 以上——但冲得越高越可疑:OpenAI 的审计发现,GPT-5.2、Claude Opus 4.5、Gemini 3 Flash 等前沿模型都能逐字背出部分题目的官方参考答案,高分里有多少是真本事已经说不清。
局限
OpenAI 已于 2026-02 宣布弃用并建议行业停用:审计 138 个难题发现 59.4% 存在实质缺陷——35.5% 的测试过窄、把功能正确但实现不同的解法误判为错,18.8% 的测试过宽、检查了题目根本没要求的功能;且所有受测前沿模型都存在训练数据污染。本站保留此条主要是历史定位,新项目建议看 SWE-bench Pro。
典型任务
以经典任务 astropy-14635 为例:用户报告天文数据库 astropy 的 QDP 文件读取器有个 bug——它错误地假设输入命令必须全是大写,导致「read serr 1 2」这样的小写命令直接崩溃,而 QDP 格式本身是不区分大小写的。agent 只拿到这段用户吐槽和整个 astropy 源码,要自己找到 QDP 解析模块、改成兼容大小写、且不影响其他读取逻辑。多数顶尖 agent 在这题上栽过跟头:要么补丁只处理了用户给的特例(过拟合),要么改动不完整、没覆盖边界情况。
沿革
- 2023-10:原版 SWE-bench 发布(Princeton NLP,2294 个真实 GitHub issue)
- 2024-08:与 OpenAI 合作推出人工筛选的 500 题 Verified 版
- 2024–2026:成为编程榜事实标准,头部模型分数一路冲到 80% 以上
- 2026-02:OpenAI 审计 138 个难题发现 59.4% 有实质缺陷,宣布弃用并建议行业停用