Video-MMMU 测试集档案
Video-MMMU 测试集中文档案:让 AI 看专业课视频,考完知识还能不能会用 由 南洋理工 S-Lab × CMU(Kairui Hu 等,MMMU 团队同源),arXiv:2501.13826(2025-01) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- Video-MMMU
- 南洋理工 S-Lab × CMU(Kairui Hu 等,MMMU 团队同源),arXiv:2501.13826(2025-01)
已发布事实
- 规模
- 300 段专家级课程/讲座视频、900 道人工标注题(每视频 3 题)
- 覆盖
- 6 学科、30 个科目;视频平均约 506 秒
- 三阶段
- 感知(认出关键信息)→ 理解(解释概念)→ 迁移(用到新问题)
- 特色指标
- Δknowledge:看视频前后做题准确率之差,直接量化「学到多少」
- 出题团队
- 南洋理工 S-Lab × CMU,与 MMMU 团队同源(Xiang Yue 参与)
它测什么
把视频当「教材」而不是「素材」:300 段专家级课程/讲座视频(平均约 506 秒)、900 道人工标注题,覆盖艺术、商业、科学、医学、人文、工程 6 学科 30 个科目。它按人类学习的三个认知阶段出题:感知(能否从视频里认出关键信息)、理解(能否解释背后的概念)、迁移(能否把视频教的知识用到没见过的新问题上)。独有的 Δknowledge 指标直接量化「看完视频后做题正确率涨了多少」,即知识获取能力。
怎么测
每段视频配 3 道与认知阶段对齐的问答题,按准确率计分。Δknowledge 的玩法是先不让模型看视频直接做题,再看视频后做题,两次准确率之差就是知识增益。迁移阶段的题刻意用视频里没出现过的新场景,防止靠记忆蒙对。
分数怎么看
论文公布的人类基线很有冲击力:人看完视频后 Δknowledge 提升 33.1 个百分点,而当时最好的模型提升幅度明显更小,且认知阶段越高(感知→理解→迁移)分数掉得越陡。这个榜的意义不在总分高低,而在揭示「AI 从视频里学知识」这条链路还很弱。
局限
规模较小(300 视频/900 题),统计噪声比大榜大;视频同样来自公开渠道,存在污染可能。注意与 Video-MME 是两套完全不同的基准:Video-MME 考通用视频内容理解,Video-MMMU 考专业知识获取与迁移,名字相近但分数毫无可比性。
典型任务
工程学科的迁移题:视频讲解带时间戳的深度优先搜索(DFS)示例,题目却把图换成带环的更复杂结构,要求判断哪些是合法的 DFS 森林——必须真学会算法而不是背住例子。医学学科的迁移题:看完一段骨盆病理讲座后,给一张视频中没出现过的全新骨盆 X 光片让模型诊断异常,正确答案是「耻骨联合切除」,考的是把病理概念用到新影像上。
沿革
- 2025-01-23:arXiv 论文上线(2501.13826),提出三认知阶段 + Δknowledge 指标
- 2025-03:官方榜单更新,收录 Kimi-k1.6-preview 等当时新模型
- 2026:被斯坦福《AI Index Report 2026》作为视频知识获取能力的代表基准收录引用