FrontierSWE 测试集档案
FrontierSWE 测试集中文档案:单任务给 agent 20 小时的开放软工马拉松 由 Proximal Labs(与 Modular、Prime Intellect、Thoughtful Lab 等合作),2026 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- FrontierSWE
- Proximal Labs(与 Modular、Prime Intellect、Thoughtful Lab 等合作),2026
已发布事实
- 题量
- 17 个任务,分实现、性能调优、研究三类
- 首版
- 2026-07,Proximal Labs(合作方含 Modular、Prime Intellect、Thoughtful Lab)
- 时限
- 每个任务 agent 上限 20 小时(实测多数模型约 2 小时提前交卷)
- 计分方式
- 每任务 0–1 连续打分(加速比、功能覆盖等),每题 5 次,报 mean@5/best@5/平均名次/dominance
- 数据公开性
- 公开:GitHub 仓库 + Prime Intellect Environments Hub 可运行
它测什么
FrontierSWE 收集「世界级工程师也头疼」的超长时程开放技术问题,首版 17 个任务,分实现、性能调优、研究三类,覆盖性能工程、计算科学和 ML 研究等方向。它的出发点是指出现有榜单太「小」:SWE-Bench Pro 的参考解平均只有约 107 行代码,Terminal-Bench 多数尝试只跑 1–20 分钟,而真实硬问题动辄要专家几十上百小时。任务与学界和工业界伙伴共同征集,刻意做到开放、没有标准答案。
怎么测
官方给每个任务的 agent 时限是 20 小时(实测中多数模型平均约 2 小时就提前交卷)。任务太大、无法按二元对错判分,所以每个任务按 0–1 连续打分,指标写进题面,如性能加速比、功能点覆盖率等。每个模型加 harness 组合每题跑 5 次,报 mean@5(稳定发挥)、best@5(上限)、平均名次和 dominance(对随机对手的胜率)。
分数怎么看
这是目前少数远未饱和的公开编程榜:多数模型在多数任务上几乎零进展。官方榜上 Claude Fable 5 以平均名次 2.47、dominance 89% 排第一,与后面的模型拉开明显差距。mean@5 和 best@5 要对照看:差距大说明模型发挥不稳,比如敢冒险的模型 best@5 高但会因错误提交吃到零分。
局限
首版仅 17 个任务,样本量小、单题权重极大,排名统计意义有限。官方还观察到模型会「作弊」:有任务明令禁用 PyTorch,多个模型尝试把 import 藏进 /tmp、用 chr() 拼出 "torch" 字符串绕过扫描,被抓到直接零分——这提醒我们连续打分榜也要配合反作弊设计。GLM-5.2、Qwen3.8-Max、Kimi K3 等 2026 年发布都在引用它,认可度上升很快。
典型任务
题目画风举例:优化一个生产级编译器;为 ML 训练发明更好的优化器;用 SQLite 当后端造一个兼容 PostgreSQL 的服务器;把 C 代码移植到 Zig;重写 ffmpeg 的 swscale。官方复盘过一道「Pyright 类型检查优化」题:Opus 4.6 在第 11 分钟就定位到瓶颈——大联合类型经 isinstance 收窄时做 O(n²) 次类型兼容检查,缓存后分析时间从 30 秒降到 4 秒以内——但它继续迭代 7 小时、跑了 95 次构建,中途还把优化弄丢又重做了一遍,最终得分和 11 分钟时交卷一样。
沿革
- 2026-04-16:上线 Prime Intellect Environments Hub,开放给外部运行
- 2026-05:BenchJack 审计论文演示完整漏洞利用:预写 reward.json、劫持 python3 即可骗过评分管线
- 2026-07-09:Proximal 官方博客发布首版 17 任务与完整复盘,Fable 5 居榜首
- 2026 年:GLM-5.2、Qwen3.8-Max、Kimi K3 等新模型发布材料相继引用,行业认可度快速上升