SWE-bench Pro 测试集档案
SWE-bench Pro 测试集中文档案:Verified 的加难防背题版,企业级修 bug 考试 由 Scale AI,2025-09(arXiv:2509.16941) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- SWE-bench Pro
- SWE-Bench Pro
- 上代参考 · SWE-bench Pro
- SWE-bench Pro(3.1 Pro 参考)
- SWE-Bench Pro 编程榜
- Scale AI,2025-09(arXiv:2509.16941)
已发布事实
- 题量
- 1865 题 / 41 仓库(public 731、held-out 858、commercial 276)
- 发布
- 2025-09(Scale AI,arXiv:2509.16941)
- 计分
- % Resolved(pass@1),统一 SWE-Agent 脚手架
- 任务规模
- 参考补丁平均 107.4 行、跨 4.1 个文件,每题至少改 10 行
- 数据公开性
- 仅 public 集公开;held-out 保密防刷榜,commercial 只公布分数
- 抗污染设计
- public/held-out 全选 GPL 系 copyleft 仓库,commercial 为购买的创业公司私有代码库
它测什么
1865 个来自 41 个活跃仓库的企业级任务,刻意解决 SWE-bench Verified 的两大痛点:一是太简单(Verified 的 500 题里有 161 题只需改一两行),二是易污染。Pro 只收需要多文件大改的任务——参考补丁平均 107.4 行、横跨 4.1 个文件,每题至少改 10 行,超过 100 题要改 100 行以上。防污染手段很硬核:公开集全部选自 GPL 等强 copyleft 协议仓库(法律上难以进入商业训练语料),商业集干脆买下创业公司的私有代码库出题。
怎么测
与 SWE-bench 同宗:agent 拿到任务描述和仓库,产出补丁,跑 fail-to-pass 加 pass-to-pass 测试,全过算 Resolved,报 % Resolved。但输入比 Verified 更「贴心」:除了改写过的问题陈述,还附人工撰写的需求清单(requirements)和接口约定(明写测试期望的类名、函数名,避免「功能对但名字起错」的冤案)。评测在与语言匹配的容器环境里进行(Python 虚拟环境、Node.js、Go module 等),环境以预构建 Docker 镜像发布。数据集分 public(731 题,公开带官方榜单)、held-out(858 题,保密防刷榜)、commercial(276 题,创业公司私有代码,只公布分数)三部分。
分数怎么看
发布时(2025-09)在统一 SWE-Agent 脚手架下,GPT-5 只有 23.3%、Claude Opus 4.1 为 22.7%,商业集更是全军不到 20%——对比 Verified 的 70%+,差距肉眼可见。按核验口径,目前前沿模型约 23%–69%,分数拉开了档次,是当前衡量顶尖编程 agent 更可信的一把尺。
局限
三个子集难度和用途不同:只有 public 集有公开榜单,held-out 和 commercial 的分数别与 public 混着比。另外分数与脚手架强相关(论文里 Agentless 因不擅多文件编辑得分明显更低),引用数字时注意对齐评测用的 agent 框架。
典型任务
论文给出的任务形态是:一道题可能来自一个 B2B 平台仓库,问题陈述说「给 API 增加某功能」,附带的 requirements 会列出一条条具体验收条件——比如明确规定新增路由的名字和行为,但不规定你怎么实现。参考答案往往要同时改动接口层、业务逻辑和测试相关文件,合计上百行。对比 Verified 里大量「改一行正则」的题,这里的每道题更像工程师真实的一周工作量(论文定位为专业人士数小时到数天的任务)。
沿革
- 2025-09:发布:统一 SWE-Agent 脚手架下最强模型不到 25%,与 Verified 的 70%+ 形成鲜明落差
- 2026-02:OpenAI 弃用 SWE-bench Verified,行业重心转向 Pro
- 2026:头部模型公开集分数爬到约 69%,商业集仍是硬骨头(发布时全军不到 20%)