测试集:MATH-500
| 名称 | MATH-500 |
|---|---|
| 类别 | reasoning |
| 主办方 | 原始 MATH 为 Hendrycks et al. 2021;500 题采样由 OpenAI(prm800k math-splits) |
| 开源状态 | open |
| 网址 | 官方页面 |
math-50097.3经典 MATH 精选 500 题、LaTeX boxed 判分、符号等价容错、Level 1-5 分档、已近饱和
测试集content/benchmarks/math-500.md
一句话
经典 MATH 题库的 500 题精选子集
测什么
原始 MATH 是 Hendrycks 等人 2021 年发布的 1.25 万道高中竞赛数学题;MATH-500 是 OpenAI 在 PRM800K 项目中从 MATH 测试集抽出的 500 题子集(math-splits),因为体量适中、判分方便,成了社区默认的快速数学评测集。题目覆盖预代数、代数、几何、数论、计数与概率、中级代数、预备微积分 7 个主题,难度分 1–5 级,每题都要求给出 LaTeX 格式的最终答案。
怎么测
模型看到题目后输出完整解答,把最终答案写在 \boxed{} 里;判分用符号等价(比如 1/2 和 0.5、3√13 的等价写法都算对)而非简单字符串匹配。报整体准确率,也常按难度级别拆开看。HuggingFaceH4/MATH-500 是最常用的数据版本。
典型任务
简单的如 Level 3 数论题「196 有多少个正整数因子?」——先分解 196=2²·7²,答案 9。难的如 Level 5 中级代数题「求不超过 (√7+√5)⁶ 的最大整数,不许用计算器」——标准技巧是配上共轭项 (√7−√5)⁶ 凑出整数,答案 13535。还有绕两层的「284 的真因子之和的真因子之和是多少」(答案恰好回到 284)。可以看出 5 级题已经需要真正的技巧,不是套公式能解决的。
分数怎么看
它曾是衡量数学能力的主力指标,但 2024 年后快速饱和:DeepSeek-R1 已达 97.3%,头部模型基本都在 95% 上下。如今它主要用作中小模型的回归测试和训练过程监控——前沿模型之间的差距在这个集上已经看不出来了。
含金量与局限
题目和解答在网上流传多年,污染风险高,高分不能证明模型没见过题;接近饱和导致对前沿模型丧失区分度;500 题全部来自同一个原始题库,覆盖面窄。看前沿模型的数学能力请转去 AIME 新年份、HMMT 或 MathArena Apex。
冷知识
集里有道「绕两层」的数论题:求 284 的真因子之和的真因子之和——答案是 284 自己。背后是 220 与 284 这对著名的亲和数,古人拿它们象征友谊;这道题相当于让模型亲手验证一遍两千多年前的数学冷知识。
数据来源
本页由仓库 content/benchmarks/math-500.md 初始化。后续修订通过公开审核队列发布。