Toolathlon 测试集档案
Toolathlon 测试集中文档案:让 AI 同时操作 32 个真实软件,完成十项全能式杂务 由 HKU/CMU 等(Junlong Li 等,ICLR 2026),arXiv:2510.25726 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- Toolathlon
- HKU/CMU 等(Junlong Li 等,ICLR 2026),arXiv:2510.25726
已发布事实
- 全称
- The Tool Decathlon(工具十项全能)
- 发布方
- HKU、CMU 等 21 位研究者(Junlong Li 领衔,Junxian He 资深作者)
- 任务规模
- 108 任务、32 个真实应用、604 个工具(多为 MCP 服务器)
- 任务领域
- 研究、校园、金融、技术、商业、日常事务、电商七类
- 交互长度
- 平均每任务约 20 轮工具调用
- 判分
- 人工编写的执行式检查脚本验证环境最终状态,不用 LLM 裁判
它测什么
全称 The Tool Decathlon(工具十项全能),测的是 agent 在一堆真实软件之间穿梭完成长程杂事的能力。它接入 32 个真实应用——从 Google Calendar、Notion 这类日常工具,到 WooCommerce、Kubernetes、BigQuery 这类专业平台——共暴露 604 个工具(大多基于 MCP 服务器)。任务故意写得像真人随口提的需求,考察模型能否自己选对工具、排对顺序、连续操作几十步不出错。
怎么测
共 108 个人工编写的任务,横跨研究、校园、金融、技术、商业、日常事务、电商七个领域,平均每个任务要约 20 轮工具调用。每个任务都先用真实软件状态初始化环境(比如日历里已有会议、数据库里已有数据),agent 操作完后由人工编写的执行式脚本直接检查环境的最终状态和产物,达到约 90% 的检查点才算成功,报任务成功率——不用 LLM 当裁判,没有模糊空间。
分数怎么看
论文发布时(2025-10)最强模型 Claude-4.5-Sonnet 只有 38.6% 成功率,连及格线都不到。此后分数上涨很快:Anthropic 系统卡披露 Claude Opus 4.8 在内部 harness 上达 59.9%(Pass@1、3 次取平均),官方榜单上游最强约 56.5%。不同 harness 下分数差异明显,比较时要对齐评测配置。
局限
任务数只有 108 个,统计噪声天然偏大;真实 MCP 环境和应用版本会随时间漂移,复现性不如纯静态基准。Anthropic 等厂商报的是自己内部 harness 的成绩,与上游官方 harness 不完全可比。作为 2025 年底才出现的新榜,头部分数一年内已上涨约 20 个百分点,需留意饱和速度。
典型任务
论文摘要里给的典型场景:agent 需要「监控一个生产数据库,发现异常,然后按照操作手册生成报告」——这要求它连数据库、跑查询、读手册文档、再生成报告文件,跨多个应用连续操作。另一类任务是「协调日历和文件系统来管理邮件」:先查日历确认日程,再从文件系统找附件,最后处理邮件。每个任务开始前环境都被布置成真实状态,agent 面对的不是空白沙盒。
沿革
- 2025-10-29:arXiv 预印本发布(arXiv:2510.25726),108 任务全部人工编写或采集
- 2025-12:「最强模型 Claude-4.5-Sonnet 仅 38.6%」的结果出圈,成为「工具使用天花板」的代名词
- 2026-01:被 ICLR 2026 接收为 poster
- 2026 年:Anthropic 在 Opus 4.6/4.7/4.8 系统卡中连续报告内部成绩 56.8%→59.3%→59.9%,该榜成为旗舰模型标配