Claw-Eval 测试集档案
Claw-Eval 测试集中文档案:不只看 AI 办没办成,还全程审计它怎么办的 由 北京大学 × 香港大学(Ye et al.,arXiv:2604.06132,2026-04) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- Claw-Eval
- Claw-Eval 自主 Agent
- 北京大学 × 香港大学(Ye et al.,arXiv:2604.06132,2026-04)
已发布事实
- 规模
- 300 个人工核验任务,9 大类分 General / 多模态 / 多轮对话三组
- 评分项
- 2,159 条细粒度 rubric,平均每题 7.2 条
- 三维评分
- Completion + Robustness 加权,Safety 做乘法门控(违规一票否决)
- 指标
- Average Score / Pass@3(能力上限)/ Pass^3(可靠性下限),每题跑 3 次
- 特色机制
- 全轨迹三通道审计(执行轨迹、审计日志、环境快照)+ 可控故障注入
它测什么
测自主 agent 的端到端可信度:300 个人工核验任务、9 大类分三组——General 服务编排(161 题,易/中/难三档)、多模态感知与生成(101 题:视频、文档图片、代码生成视觉产物)、多轮专业对话(38 题:STEM、社科、商业咨询)。核心理念是「轨迹可审计」:不只检查最终产物,还全程记录 agent 实际做了什么;同时把安全约束嵌进普通任务里,并用可控故障注入测鲁棒性。
怎么测
每次评测分 Setup/Execution/Judge 三个阶段严格隔离,通过三条独立证据通道取证:执行轨迹、服务端审计日志、环境快照。300 题拆解出 2,159 条细粒度 rubric(平均每题 7.2 条),客观条件用确定性规则查、开放标准用 LLM judge。总分 = 安全分(乘法门控,违规一票否决)×(完成度与鲁棒性加权)。每题跑 3 次,报 Average Score、Pass@3(至少过一次,能力上限)和 Pass^3(三次全过,可靠性下限)。
分数怎么看
论文实测 14 个前沿模型:Claude Opus 4.6 以总分 80.4、Pass^3 70.4% 居首,Sonnet 4.6 平均分最高(81.4)。多模态明显最难,Pass^3 最高的 GPT-5.4 也只有 25.7%。故障注入实验很有说服力:把工具失败率加到 0.6,各模型 Pass@3 几乎不降、Pass^3 最多跌 24 个百分点——「偶尔办成一次」和「稳定办成」是两回事,单看前者会高估 agent。
局限
开放标准的 rubric 依赖 LLM judge(论文报告与人工评分 95% 一致);外部服务多为 mock,鲁棒性只覆盖基础设施层故障(HTTP 429/500、延迟尖峰),不含语义级对抗。名字容易撞车:勿与 ClawsBench、CLAWMARK、ClawArena 等相近名称混淆;另有动态更新的续作 Claw-Eval-Live,引用时注意是哪一版。
典型任务
General 难档是跨系统编排、财务合规、运维工单这类多服务协作;多模态组有视频内容定位、跨页图表推理、网页生成、SVG 动画、视频剪辑。最有特色的是多轮对话:模拟用户扮演「藏着意图」的咨询者(如法律、投资咨询),关键信息分最多 8 轮逐步透露,agent 必须主动追问才能答对——论文分析显示提问质量解释了 76% 的成绩差异,而对话轮数几乎无关(r=0.07),「会问问题」比「聊得久」重要得多。
沿革
- 2026-04-07:arXiv v1 发布(2604.06132),北大 × 港大,benchmark 与评测框架全开源(claw-eval.github.io)
- 2026-05-07:v3 修订:14 模型完整结果、混合裁判对照实验、故障注入分析
- 2026:推出动态更新的续作 Claw-Eval-Live,缓解固定题集的过拟合问题