测试集:MMLU-Pro
| 名称 | MMLU-Pro |
|---|---|
| 类别 | reasoning |
| 主办方 | TIGER-Lab(滑铁卢大学、卡内基梅隆大学等),NeurIPS 2024,arXiv:2406.01574 |
| 开源状态 | open |
| 网址 | 官方页面 |
mmlu-pro89.810 选项降蒙对率、14 学科 12,032 题、5-shot CoT、专家审核干扰项、提示词稳健
测试集content/benchmarks/mmlu-pro.md
一句话
MMLU 的加固版:选项加到十个,专考真推理
测什么
MMLU-Pro 是为了修 MMLU 的三大毛病而生:饱和、对提示词敏感、知识题多推理题少。它把 57 个学科合并成 14 个大类(数学、物理、化学、法律、工程、心理学、健康等),共 12,032 题,选项从 4 个扩到 10 个,蒙对概率从 25% 降到 10%。题目来源除了清洗后的 MMLU 原题,还补了 STEM 题库网站、TheoremQA(需要用定理求解)和 SciBench(大学理科考试题)里更硬的部分,并经过两轮专家审核纠错。
怎么测
构造过程颇有讲究:先用 8 个 7B 级别小模型跑 MMLU,凡是被 4 个以上小模型答对的「太简单」题一律删掉(共删 5,886 题);再用 GPT-4-Turbo 给每题补出 6 个貌似合理的干扰项,专家复核确保干扰项确实是错的;最终 83% 的题有满 10 个选项,平均每题 9.47 个。标准测法是 5-shot CoT(带思维链示例),模型输出推理过程和最终选项,用正则抽取 A~J 答案算准确率。实测它比 MMLU 稳得多:换 24 种提示词风格,分数波动从 4~5% 缩到 2%。
典型任务
和 MMLU 最大的差别在题目「含算量」。MMLU 的物理题多是概念辨析(比如抛球瞬间加速度是多少),MMLU-Pro 里工程、物理类的题则要求列公式、做多步推导和数值计算,再在十个数值选项里挑出正确结果——论文发现工程学科分数低,主要就栽在这类复杂公式推导题上。论文对 GPT-4o 的 120 道错题做了人工归因:39% 是推理过程出错,35% 是缺领域知识,12% 是算错数,能看出这榜确实在考「会想」而不是「会背」。
分数怎么看
2024 年发布时最强的 GPT-4o 只有 72.6%,同期它在 MMLU 上是 87.4%——分数直接掉了一截,模型间差距也从 1% 拉开到 9%,区分度明显更好。论文还证实 CoT 思维链在这个榜上能显著提分(GPT-4o 提了 19%),而在 MMLU 上反而帮倒忙,说明这里的题真需要一步步想。如今它是各家模型报告里的常客,70%~85% 区间仍有区分度。
含金量与局限
它本质上还是选择题,考不了开放性证明和长链条产出。干扰项由 GPT-4-Turbo 批量生成,虽经两轮专家审核,题目质量终究不如纯手工题库。另外它的题源(MMLU、STEM 网站、TheoremQA、SciBench)都是公开材料,污染风险随时间上升,高分同样可能含水分。
冷知识
筛掉「太简单」题的方式是让 8 个 7B 小模型投票:超过一半答对就删,一口气删了 5,886 题。同一条 CoT 思维链在老 MMLU 上帮倒忙、在这里给 GPT-4o 提了 19%,成了两代榜的分水岭。
数据来源
本页由仓库 content/benchmarks/mmlu-pro.md 初始化。后续修订通过公开审核队列发布。