MMMU 测试集档案
MMMU 测试集中文档案:大学 30 个学科的图文混合专家级考试 由 CMU、滑铁卢大学、俄亥俄州立等(Xiang Yue 等),NeurIPS 2024 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- MMMU
- MMMU Pro
- MMMU Pro 多模态
- CMU、滑铁卢大学、俄亥俄州立等(Xiang Yue 等),NeurIPS 2024
已发布事实
- 题量
- 11,550 道(测试集约 10.5K + 验证集约 900 + 每科 5 题开发集)
- 覆盖面
- 6 大学科、30 个科目、183 个细分方向
- 图片类型
- 30 种(图表、地图、乐谱、化学结构、医学影像等)
- 出题方式
- 50 多名各专业大学生手工收集,刻意避开答案随题可搜的题源
- 计分
- 微平均准确率,规则流水线抽答案比对
- 加强版
- MMMU-Pro(2024-09):10 选项、剔除纯文本可答题、vision-only 模式
它测什么
约 1.15 万道来自大学考试、测验和教科书的多模态题目,覆盖艺术、商业、科学、医学、人文社科、工程六大学科、30 个科目、183 个细分方向。它测的不是日常看图说话,而是「看懂专业图表 + 调用学科知识 + 逐步推理」三者合一的专家级能力:图片类型多达 30 种,包括乐谱、化学结构式、医学影像、地图、表格等,很多题必须图文联合理解才有解。题目由 50 多名各专业大学生手工收集,并刻意避开答案直接可搜到的题源。设计上对标「专家级 AGI」——能在大学层面各科都过关,才算摸到专家门槛。
怎么测
以选择题为主、也有开放问答,按微平均准确率计分。评测用规则流水线从模型长回复中抽取答案再比对;选择题抽不出答案时按随机选一个兜底。数据分开发集(每科 5 题)、验证集约 900 题、测试集约 1.05 万题;测试集答案原本托管在 EvalAI 服务器防泄漏,2026-02 官方已公开测试集答案、支持本地评测。
分数怎么看
发布时 GPT-4V 只有 55.7%、最强开源模型约 34%,人类专家约 88.6%;到如今头部模型已冲上 70% 以上,原版 MMMU 的区分度在下降。读分时注意同一模型在不同学科差距很大:乐谱、化学结构、几何图形类图片上模型普遍明显更弱。
局限
题目源自公开教材和网络资源,存在污染风险,作者也承认人工筛选难免有偏。为此官方 2024-09 推出 MMMU-Pro:剔除纯文本可答的题、选项扩到 10 个、并有把题干嵌进图片的 vision-only 模式,模型分数普遍掉 16.8–26.9 个百分点——引用分数时务必说清是 MMMU 还是 MMMU-Pro,两者不可混比。
典型任务
论文错误分析里有真实案例:一道计算机科学题给出自动机状态图,模型能看到图里的双圈节点却不知道它在确定有限自动机里代表「接受状态」,卡在专业知识上;另一道文科题给出一幅把美国描绘成「救世主」的政治漫画,模型却抛开画面、只按文本里「帝国主义」的字面意思作答。这两类错误——看不懂专业图示、重文轻图——正是 MMMU 想暴露的问题。
沿革
- 2023-11-27:arXiv 论文上线(2311.16502),提出对标「专家级 AGI」的多学科多模态基准
- 2023-12-04:测试集评测服务器在 EvalAI 上线,答案保密防泄漏
- 2024-01-31:官方榜单加入人类专家表现作参照
- 2024-09-05:发布加强版 MMMU-Pro(arXiv:2409.02813),模型分数普降 16.8–26.9 个百分点
- 2024-12:NeurIPS 2024 正式录用
- 2026-02-12:官方公开测试集答案,评测转本地进行