LiveBench 测试集档案
LiveBench 测试集中文档案:每月换题的防污染联考,客观答案自动判分 由 Abacus.AI / NYU / NVIDIA / USC / UMD 等(Yann LeCun、Tom Goldstein 等),arXiv:2406.19314,ICLR 2025 Spotlight 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- LiveBench
- LiveBench Coding
- Abacus.AI / NYU / NVIDIA / USC / UMD 等(Yann LeCun、Tom Goldstein 等),arXiv:2406.19314,ICLR 2025 Spotlight
已发布事实
- 发布
- 2024-06(arXiv:2406.19314),ICLR 2025 Spotlight 论文
- 作者阵容
- Abacus.AI / NYU / NVIDIA / USC / UMD,Yann LeCun、Tom Goldstein 等
- 现版规模
- 2026-06-25 题目批:7 大类 23 个客观任务(新增 Agentic Coding)
- 更新机制
- 题目按月滚动发布,取材最近竞赛/论文/新闻/数据集
- 判分
- 客观 ground-truth 自动判分,全程无 LLM 评审、无人类投票
- 难度设计
- 刻意校准到让头部模型落在 30-70% 区间
它测什么
针对「测试题泄露进训练集」这个行业顽疾设计的联考:题目全部取材自时效性来源——最近 11 个月内的数学竞赛题、新发表的 arXiv 论文、新上映电影的简介、新发布的数据集——并且按月滚动发布新题,让模型来不及「背题」。分 6 大类:数学、编程、推理、语言理解、指令遵循、数据分析,每类 2-4 个任务、每任务 40-100 题,难度刻意校准到让头部模型落在 30-70% 区间。与偏好榜相反,它拒绝任何主观评判,只要唯一正确答案。
怎么测
每题都有可验证的客观 ground-truth,程序自动判分,不用 LLM 评审、不用人类投票,从机制上杜绝评审偏置。报各类目分和总分(0-100 正确率)。题目按月更新、任务不定期加难或扩充,官方明确提示不同时间窗口的分数不可直接比较。站内常引用的「LiveBench Coding」只是其中的编程类目分。
分数怎么看
2024-06 发布时最强模型总分也压不到 70%,区分度明显好于同期已饱和的榜单。由于题目按月换,它的分数更像「当期快照」:看分数时务必核对题目版本日期,跨年比较意义有限。编程类目分(LiveBench Coding)常被单独引用,别和总分混为一谈。
局限
滚动更新只能降低不能根除污染——老题一旦公开就永远流传。客观判分的另一面是测不了开放式写作、对话这类没有唯一答案的能力。第三方统计站点上该榜大量结果为厂商自报,与官方统一跑分可能不一致,引用时最好对照 livebench.ai 官方榜。
典型任务
论文里的真实构造:数学类用近 11 个月高中数学竞赛改编题加 AMPS 加难版;编程类取当期 LeetCode / AtCoder 新题(经 LiveCodeBench);推理类把 BIG-Bench Hard 的「Web of Lies」加难,再配斑马谜题(「五个人住五栋不同颜色的房子……谁养斑马」式逻辑题)和空间推理;语言类把新片在 IMDb 上的剧情简介打乱顺序让模型复原,或玩 Connections 连词谜题;指令遵循类拿《卫报》近期新闻,要求改写成指定字数并满足若干硬性约束。
沿革
- 2024-06-12:GitHub 开源;6 大类 18 任务,发布时最强模型总分不足 70%
- 2024-06-27:arXiv:2406.19314 论文公开,确立「月度换题 + 客观判分」方法论
- 2025-01:入选 ICLR 2025 Spotlight
- 2024-06 起:按月滚动发布新题批,并不定期加难或扩充任务
- 2026-06-25:题目批扩展至 7 大类 23 任务(新增 Agentic Coding 类目),37 个模型变体在榜