OpenHands Index 测试集档案
OpenHands Index 测试集中文档案:五项工程任务打包,给编程模型算「综合高考分」 由 OpenHands 团队(Graham Neubig 等),2026-01-29 发布 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- OpenHands Index
- OpenHands Index 开源榜
- OpenHands vibe check
- OpenHands 团队(Graham Neubig 等),2026-01-29 发布
已发布事实
- 构成
- SWE-bench Verified + Commit0 + SWE-bench Multimodal(核验版)+ SWT-bench + GAIA
- 统一框架
- 所有模型在同一 OpenHands Agent SDK 上跑,模型是唯一变量
- 三维度
- 五类加权综合分 + 每实例平均成本(美元)+ 平均耗时(秒)
- 任务来源
- 按 OpenHands 云端真实流量的高频工作类型选样
- 开源
- OpenHands/benchmarks 仓库,持续更新
它测什么
软件工程 agent 的综合指数,本质是个「元基准」:用 OpenHands 统一的 agent 框架,把五个现成基准打包成一次大考——SWE-bench Verified(修 GitHub issue)、Commit0(从零开发全新项目)、SWE-bench Multimodal 核验版(前端开发)、SWT-bench(给 bug 写复现测试)、GAIA(查 API 和实现细节的信息收集)。五类任务对应 OpenHands 云端真实流量里用户最常让 agent 干的五类活,避免单一基准(比如只测修 issue)以偏概全。
怎么测
所有模型在同一 OpenHands Agent SDK 上跑全部五类任务,模型是唯一变量。报一个五类加权综合分,同时公开每个实例的平均成本(美元)和平均耗时(秒)——三个维度一起看,方便按「能力 / 预算 / 速度」选型。实现全部开源在 OpenHands/benchmarks 仓库。
分数怎么看
首批 9 个模型的结论:Claude 4.5 Opus 综合第一且五项无明显短板,GPT-5.2 Codex 总分第二、长程开发最强,Gemini 3 Flash 和 DeepSeek v3.2 Reasoner 是性价比之选。后续第三方收录的数据里头部已到 65 分上下(如 Gemini 3.1 Pro 65.02)。每实例成本约 4–15 美元,模型间差好几倍——分数之外这一栏同样值得看。
局限
元基准的天然属性:成绩依赖五个子基准的版本,也依赖 OpenHands 框架本身——换个 agent 框架(Claude Code、Codex 等)排名可能不同,所以它测的是「模型 × OpenHands」的组合表现。子基准之一 SWE-bench Verified 已被 OpenAI 宣布弃用(详见其条目),争议会部分继承;由 OpenHands 团队自办,对自家框架的适配天然最熟。
典型任务
五类任务对应五种真实工作画面:给真实开源仓库修一个 issue;从零起步长程开发一个完整应用(GPT-5.2 Codex 在这类任务上能连续工作两倍时长、成功率明显更高,社区著名案例是它跑了一周做出一个基本可用的浏览器原型);按截图改前端界面;给一个报错的仓库写出能复现 bug 的单元测试;以及开发中查资料——把 API 文档和实现细节找全。
沿革
- 2026-01-29:正式发布,首批评测 Anthropic/OpenAI/Google/DeepSeek/Qwen 等 9 个模型,Claude 4.5 Opus 综合第一
- 2026-02:子基准之一 SWE-bench Verified 被 OpenAI 宣布弃用,Index 部分继承其争议
- 2026 起:榜单持续滚动更新,成为按「能力/成本/速度」三维权衡选模型的常用参考