CursorBench 测试集档案
CursorBench 测试集中文档案:从真实 Cursor 会话里抽的模糊多文件任务 由 Cursor / Anysphere(3.0 于 2026-03 随 Composer 2 技术报告披露,3.1 于 2026-07) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- CursorBench
- CursorBench 3.2
- Cursor / Anysphere(3.0 于 2026-03 随 Composer 2 技术报告披露,3.1 于 2026-07)
已发布事实
- 任务来源
- 真实 Cursor 生产会话,Cursor Blame 回溯「请求→已提交代码」配对
- 当前版本
- 3.2(3.0 于 2026-03 随 Composer 2 技术报告披露,3.1 于 2026-07)
- 计分方式
- 正确性、代码质量、效率、交互行为四维度 + 成本/token/步数
- 配套指标
- 与线上 Keep Rate(用户保留 AI 代码比率)混合评估
- 数据公开性
- 不公开,厂商内部基准
- 刷新频率
- 任务集每隔几个月刷新,跟随真实开发者用法演变
它测什么
CursorBench 是 Cursor 的内部评测套件,任务不靠人造,而是从真实 Cursor 生产会话中抽取:用一套叫 Cursor Blame 的方法把已提交的代码回溯到当初那条 agent 请求,天然得到「真实需求 → 真实结果」的配对。题目画像是工程师的日常:模糊需求、多文件改动、monorepo、多工作区环境、查生产日志、盯长时任务,覆盖编辑、重构、修 bug、理解、规划、评审六类,且任务集每隔几个月刷新一次以跟上真实用法、降低背题空间。
怎么测
不按单一总分,而是四个维度打分:解答正确性、代码质量、效率、交互行为,同时记录成本、token 消耗和 agent 步数。线下分数之外还混合线上指标——最典型的是 Keep Rate(用户最终保留 AI 所写代码的比率),并辅以受控的线上实验,专门抓「榜上高分但用户不爱用」的错位。
分数怎么看
分数只有相对意义:Composer 2 技术报告自报 CursorBench 61.3 分;2026-03 有 GPT-5.4 登顶 3.0 的说法;3.2 上 Anthropic 宣称 Opus 5 在 max 档位距榜首 Fable 5 不到 0.5%、且单次任务成本减半。跨版本(3.0/3.1/3.2)口径有演进,数字不能直接串着比。
局限
任务集不公开、分数全部厂商自报,外部无法独立复现,任何「某模型登顶 CursorBench」的说法追到底都是某家发布材料。它深度绑定 Cursor 自家工作流和 Keep Rate,本质是产品选型工具而非中立的学术榜单。
典型任务
任务的「真实感」体现在规格模糊:不是「给某个函数修某个 bug」,而是一条开发者口吻的模糊请求,落在一个多文件 monorepo 里,agent 要自己弄清楚该动哪几处、怎么验证。官方称从初版到 3.0,平均任务的代码行数和涉及文件数大约翻了一倍——基准在变难的速度,基本就是真实用户对 agent 要求提高的速度。
沿革
- 2026-03-12:GPT-5.4 登顶 CursorBench 的说法见报,该榜首次进入大众视野
- 2026-03-26:Composer 2 技术报告(arXiv:2603.24477)正式介绍 CursorBench,自报 61.3 分
- 2026-07:3.1 披露;3.2 上 Fable 5 登顶,Anthropic 称 Opus 5 以一半单次成本逼近峰值
- 持续机制:任务集每隔几个月刷新一次,跟随真实开发者用法演变,降低背题空间