ClawBench 测试集档案
ClawBench 测试集中文档案:让浏览器 agent 在真实网站上订机票、点外卖、投简历 由 TIGER-AI-Lab,arXiv:2604.08523(2026-04) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- ClawBench
- ClawBench(2026-03 第三方)
- TIGER-AI-Lab,arXiv:2604.08523(2026-04)
已发布事实
- 发布方
- TIGER-AI-Lab(2026-04,arXiv:2604.08523)
- 任务规模
- V1:153 任务、144 个真实线上网站、15 个生活品类;V2 另 130 任务
- 任务性质
- 写操作、改变真实状态的流程(下单、预订、投递、邮件处理)
- 安全机制
- Chrome 扩展拦截最终提交请求,避免真实后果
- 判分
- 五层轨迹记录 + Agent-as-Judge 对比人类参考轨迹 + DOM 匹配,二元成败
它测什么
测浏览器 agent 在真实互联网上替人办日常杂事的能力。与在沙盒仿站里测试的旧榜单不同,它直接让 agent 操作 144 个真实线上网站,完成 153 个「会改变真实状态」的任务——下单、预订、投递这类写操作,正是以往基准刻意回避的。任务覆盖 15 个生活品类(出行、外卖、求职、邮件等)。V2 版本另有 130 个任务。
怎么测
关键设计是「最终请求拦截」:agent 可以在真实网站上自由浏览、填表、走到提交前的最后一步,但一个 Chrome 扩展会拦下真正产生现实后果的那个 HTTP 请求(比如真正的支付提交),从而安全地在生产网站上评测。评测全程做五层轨迹记录,再由 Agent-as-Judge 协议把 agent 的操作轨迹与人类参考轨迹对比,结合 DOM 匹配给出可追溯的二元成败判定,报任务成功率。
分数怎么看
目前的天花板很低:最强模型 Claude Sonnet 4.6 成功率仅 33.3%,而它在传统网页 agent 榜上能拿 65%–75%——论文最核心的发现就是「沙盒榜高分不代表真实网络能干活」,旧榜成绩几乎无法迁移到 ClawBench。
局限
真实网站会改版、会上新的反爬策略,任务可复现性天然随时间衰减,分数带时间戳属性。评测依赖 LLM 当裁判(与人类参考轨迹比对),裁判本身有判断误差。名字注意区分:GitHub 上另有 devswha/claw-bench 等同名项目,本条指 TIGER-AI-Lab 版。按任务属性它偏浏览器 agent 评测,并非纯编程榜。
典型任务
典型任务就是你我每天会做的事:在航司或旅行网站上订一段指定条件的行程、在外卖平台按要求下一单、在招聘网站投递一份简历、处理邮箱里的某类邮件。这些任务对人类稀松平常,对 agent 却暗藏杀机:论文的失败分析显示,反爬虫拦截、不自然的点击行为被网站识别、安全拒答等是反复出现的翻车原因。
沿革
- 2026-04-09:arXiv v1 发布,GitHub 同步开源任务集、评测工具包与 agent 轨迹
- 2026-04:「最强 AI 只能完成 1/3 日常网事」的结果引发热议,steel.dev 等第三方开始追踪榜单
- 2026-07-20:arXiv v2:扩充 trace 级失败分析(反爬拦截、非人类操作、安全拒答等),并加入 V2 任务集 130 题