跳转到内容

测试集:MMMU

来自封神榜 Wiki
名称 MMMU
类别 multimodal
主办方 CMU、滑铁卢大学、俄亥俄州立等(Xiang Yue 等),NeurIPS 2024
开源状态 open
网址 官方页面

mmmu8630 学科图文题、11,550 道、30 种图片类型、微平均准确率、MMMU-Pro 加强版

测试集content/benchmarks/mmmu.md

一句话

大学 30 个学科的图文混合专家级考试

测什么

约 1.15 万道来自大学考试、测验和教科书的多模态题目,覆盖艺术、商业、科学、医学、人文社科、工程六大学科、30 个科目、183 个细分方向。它测的不是日常看图说话,而是「看懂专业图表 + 调用学科知识 + 逐步推理」三者合一的专家级能力:图片类型多达 30 种,包括乐谱、化学结构式、医学影像、地图、表格等,很多题必须图文联合理解才有解。题目由 50 多名各专业大学生手工收集,并刻意避开答案直接可搜到的题源。设计上对标「专家级 AGI」——能在大学层面各科都过关,才算摸到专家门槛。

怎么测

以选择题为主、也有开放问答,按微平均准确率计分。评测用规则流水线从模型长回复中抽取答案再比对;选择题抽不出答案时按随机选一个兜底。数据分开发集(每科 5 题)、验证集约 900 题、测试集约 1.05 万题;测试集答案原本托管在 EvalAI 服务器防泄漏,2026-02 官方已公开测试集答案、支持本地评测。

典型任务

论文错误分析里有真实案例:一道计算机科学题给出自动机状态图,模型能看到图里的双圈节点却不知道它在确定有限自动机里代表「接受状态」,卡在专业知识上;另一道文科题给出一幅把美国描绘成「救世主」的政治漫画,模型却抛开画面、只按文本里「帝国主义」的字面意思作答。这两类错误——看不懂专业图示、重文轻图——正是 MMMU 想暴露的问题。

分数怎么看

发布时 GPT-4V 只有 55.7%、最强开源模型约 34%,人类专家约 88.6%;到如今头部模型已冲上 70% 以上,原版 MMMU 的区分度在下降。读分时注意同一模型在不同学科差距很大:乐谱、化学结构、几何图形类图片上模型普遍明显更弱。

含金量与局限

题目源自公开教材和网络资源,存在污染风险,作者也承认人工筛选难免有偏。为此官方 2024-09 推出 MMMU-Pro:剔除纯文本可答的题、选项扩到 10 个、并有把题干嵌进图片的 vision-only 模式,模型分数普遍掉 16.8–26.9 个百分点——引用分数时务必说清是 MMMU 还是 MMMU-Pro,两者不可混比。

冷知识

论文清洗数据时把约 10%「过于简单」的题直接淘汰;出题还要求避开答案随手可得的来源(答案在单独文档或教科书末尾的才收)。对 GPT-4V 的 150 个错题做尸检:35% 错在看图、29% 错在缺知识、26% 错在推理——「看错了」比「不会算」还多。

数据来源

本页由仓库 content/benchmarks/mmmu.md 初始化。后续修订通过公开审核队列发布。