Scale SEAL 测试集档案
Scale SEAL 测试集中文档案:Scale AI 的专家人工评测伞形榜单 由 Scale AI(SEAL Leaderboards 专家评估体系) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- Scale SEAL
- Scale SEAL Remote Labor
- Scale AI(SEAL Leaderboards 专家评估体系)
已发布事实
- 运营方
- Scale AI
- 性质
- 伞形专家评估品牌,非单一 benchmark
- 旗下子榜
- Remote Labor Index(RLI)、SWE-bench Pro、MCP Atlas 等
- 机制
- 专家设计任务与判分标准,LLM 辅助规模化评审;私有数据防过拟合 + 开源数据保可比
- RLI 规模
- 240 个真实付费自由职业项目,对应超 6,000 小时、超 14 万美元真实报酬
它测什么
Scale AI 运营的前沿模型评估品牌,不是单一 benchmark 而是一把「伞」:由领域专家设计高复杂度评估、定义精细判分标准,覆盖编码、指令遵循、推理等方向,用私有数据集防过拟合、开源数据集保可比性。旗下子榜包括 Remote Labor Index(RLI)、SWE-bench Pro、MCP Atlas 等。其中 RLI 最有辨识度:把真实付费的远程自由职业项目(3D/CAD、建筑设计、软件开发等 240 个 Upwork 项目,对应超 6,000 小时、超 14 万美元的真实报酬)交给 AI agent 端到端交付。
怎么测
总机制是「人类专家 + LLM 规模化」:专家设计任务与评分标准,LLM 辅助扩大评审规模并对齐人类判断。各子榜独立计分;以 RLI 为例,agent 拿到真实项目需求(含附件、交付要求)后自主完成全部工作,交付物由专家按「客户会不会验收付款」的标准判定,报自动化率——即有多大比例的真实项目能被 AI 完整交付。
分数怎么看
RLI 在 2025-10 发布时的标志性数字是:头部 agent 只能端到端完成约 2.5% 的真实自由职业项目——把「AI 取代远程工作」的宏大叙事拉回了地面;2026 年 CAIS 的跟踪报告显示这一比例显著上升,最新数字以 remotelabor.ai 官方榜为准。看 SEAL 成绩务必先确认是哪个子榜,各子榜难度和含义完全不同。
局限
伞形品牌属性:「SEAL 排名」不指明子榜就没有意义,MCP Atlas、SWE-bench Pro 等有自己的条目。专家人工评审成本高、规模小、更新慢;Scale AI 本身是数据服务公司、与被评实验室存在商业关系(如 Meta 对其投资),立场问题社区有讨论;部分子榜数据私有,外部无法独立复核。
典型任务
RLI 里的题目就是真实发包过的活儿,不是玩具题:按客户需求做一个 3D 产品模型、写一份建筑设计方案、开发一个小型软件工具、制作教学课件——这些都是自由职业者实际收了钱完成的项目。agent 要自己理解需求文档、规划工序、产出全套交付文件,专家再对照原始验收标准判断「这活儿客户认不认」。
沿革
- 2025-10-29:RLI 发布(Scale × CAIS,arXiv:2510.26787):头部 agent 只能端到端交付约 2.5% 的真实项目
- 2026-02:MCP Atlas 论文发布,作为子榜纳入 SEAL 体系
- 2026-07-01:CAIS 跟踪报告:配合更强 agent 脚手架,自动化率升至 15.8%(Fable 5)