跳转到内容

测试集:Video-MMMU

来自封神榜 Wiki
名称 Video-MMMU
类别 multimodal
主办方 南洋理工 S-Lab × CMU(Kairui Hu 等,MMMU 团队同源),arXiv:2501.13826(2025-01)
开源状态 open
网址 官方页面

video-mmmu课程视频当教材、三认知阶段、Δknowledge 指标、迁移题新场景、6 学科 30 科目

测试集content/benchmarks/video-mmmu.md

一句话

让 AI 看专业课视频,考完知识还能不能会用

测什么

把视频当「教材」而不是「素材」:300 段专家级课程/讲座视频(平均约 506 秒)、900 道人工标注题,覆盖艺术、商业、科学、医学、人文、工程 6 学科 30 个科目。它按人类学习的三个认知阶段出题:感知(能否从视频里认出关键信息)、理解(能否解释背后的概念)、迁移(能否把视频教的知识用到没见过的新问题上)。独有的 Δknowledge 指标直接量化「看完视频后做题正确率涨了多少」,即知识获取能力。

怎么测

每段视频配 3 道与认知阶段对齐的问答题,按准确率计分。Δknowledge 的玩法是先不让模型看视频直接做题,再看视频后做题,两次准确率之差就是知识增益。迁移阶段的题刻意用视频里没出现过的新场景,防止靠记忆蒙对。

典型任务

工程学科的迁移题:视频讲解带时间戳的深度优先搜索(DFS)示例,题目却把图换成带环的更复杂结构,要求判断哪些是合法的 DFS 森林——必须真学会算法而不是背住例子。医学学科的迁移题:看完一段骨盆病理讲座后,给一张视频中没出现过的全新骨盆 X 光片让模型诊断异常,正确答案是「耻骨联合切除」,考的是把病理概念用到新影像上。

分数怎么看

论文公布的人类基线很有冲击力:人看完视频后 Δknowledge 提升 33.1 个百分点,而当时最好的模型提升幅度明显更小,且认知阶段越高(感知→理解→迁移)分数掉得越陡。这个榜的意义不在总分高低,而在揭示「AI 从视频里学知识」这条链路还很弱。

含金量与局限

规模较小(300 视频/900 题),统计噪声比大榜大;视频同样来自公开渠道,存在污染可能。注意与 Video-MME 是两套完全不同的基准:Video-MME 考通用视频内容理解,Video-MMMU 考专业知识获取与迁移,名字相近但分数毫无可比性。

冷知识

AI Index 2026 转引的官方数据里有个尴尬纪录:约三分之一的受测模型 Δknowledge 为负——看了教学视频后做题反而更差,等于「上课上到走神」。该项表现最好的 GPT-4o 也只有 +15.6 个百分点,不到人类专家 +33.1 的一半。

数据来源

本页由仓库 content/benchmarks/video-mmmu.md 初始化。后续修订通过公开审核队列发布。