MMLU-Pro 测试集档案
MMLU-Pro 测试集中文档案:MMLU 的加固版:选项加到十个,专考真推理 由 TIGER-Lab(滑铁卢大学、卡内基梅隆大学等),NeurIPS 2024,arXiv:2406.01574 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- MMLU-Pro
- TIGER-Lab(滑铁卢大学、卡内基梅隆大学等),NeurIPS 2024,arXiv:2406.01574
已发布事实
- 题量
- 12,032 题、14 学科
- 选项
- 10 个(83% 的题满 10 项,平均每题 9.47 项)
- 题源
- MMLU 清洗 + STEM 题库网站 + TheoremQA + SciBench
- 计分
- 5-shot CoT 准确率
- 稳健性
- 24 种提示词下波动约 2%(MMLU 为 4~5%)
它测什么
MMLU-Pro 是为了修 MMLU 的三大毛病而生:饱和、对提示词敏感、知识题多推理题少。它把 57 个学科合并成 14 个大类(数学、物理、化学、法律、工程、心理学、健康等),共 12,032 题,选项从 4 个扩到 10 个,蒙对概率从 25% 降到 10%。题目来源除了清洗后的 MMLU 原题,还补了 STEM 题库网站、TheoremQA(需要用定理求解)和 SciBench(大学理科考试题)里更硬的部分,并经过两轮专家审核纠错。
怎么测
构造过程颇有讲究:先用 8 个 7B 级别小模型跑 MMLU,凡是被 4 个以上小模型答对的「太简单」题一律删掉(共删 5,886 题);再用 GPT-4-Turbo 给每题补出 6 个貌似合理的干扰项,专家复核确保干扰项确实是错的;最终 83% 的题有满 10 个选项,平均每题 9.47 个。标准测法是 5-shot CoT(带思维链示例),模型输出推理过程和最终选项,用正则抽取 A~J 答案算准确率。实测它比 MMLU 稳得多:换 24 种提示词风格,分数波动从 4~5% 缩到 2%。
分数怎么看
2024 年发布时最强的 GPT-4o 只有 72.6%,同期它在 MMLU 上是 87.4%——分数直接掉了一截,模型间差距也从 1% 拉开到 9%,区分度明显更好。论文还证实 CoT 思维链在这个榜上能显著提分(GPT-4o 提了 19%),而在 MMLU 上反而帮倒忙,说明这里的题真需要一步步想。如今它是各家模型报告里的常客,70%~85% 区间仍有区分度。
局限
它本质上还是选择题,考不了开放性证明和长链条产出。干扰项由 GPT-4-Turbo 批量生成,虽经两轮专家审核,题目质量终究不如纯手工题库。另外它的题源(MMLU、STEM 网站、TheoremQA、SciBench)都是公开材料,污染风险随时间上升,高分同样可能含水分。
典型任务
和 MMLU 最大的差别在题目「含算量」。MMLU 的物理题多是概念辨析(比如抛球瞬间加速度是多少),MMLU-Pro 里工程、物理类的题则要求列公式、做多步推导和数值计算,再在十个数值选项里挑出正确结果——论文发现工程学科分数低,主要就栽在这类复杂公式推导题上。论文对 GPT-4o 的 120 道错题做了人工归因:39% 是推理过程出错,35% 是缺领域知识,12% 是算错数,能看出这榜确实在考「会想」而不是「会背」。
沿革
- 2024-05:GitHub 开源
- 2024-06:arXiv:2406.01574 发布,GPT-4o 72.6% 居首,比 MMLU 低约 15 个点
- 2024-12:NeurIPS 2024 收录
- 2026-08:头部逼近 90%(Qwen3.7 Max 89.6%、AA 口径 Gemini 3 Pro 89.8%),区分度开始收窄