测试集:HMMT
| 名称 | HMMT |
|---|---|
| 类别 | reasoning |
| 主办方 | 哈佛/MIT 学生组织;基准化由 MathArena(ETH SRI)赛后数天内完成 |
| 开源状态 | open |
| 网址 | 官方页面 |
hmmt90哈佛-MIT 赛事真题、赛后数天即测、题目防污染、精确匹配判分、难度高于 AIME
一句话
哈佛-MIT 数学赛真题,赛后立刻开测防背题
测什么
HMMT 是哈佛和 MIT 学生组织合办的高水平数学竞赛,每年 2 月、11 月各一场,个人赛按代数、组合、几何、数论分轮次,题目一律要求给出最终答案(数值或表达式)。作为 AI 基准,它由 MathArena(苏黎世联邦理工 SRI 实验室)在赛后数天内把新题整理上线评测,最常用的是 HMMT February 2025 的 30 题。它的核心价值是「新鲜」:题目在模型训练数据截止之后才公开,从机制上排除背题的可能,难度又普遍高于 AIME。
怎么测
按 MathArena 协议评测:模型逐题独立作答,输出完整推理和最终答案,与官方答案精确匹配判分;每题采样多次(通常 4 次起)报平均正确率。评测紧跟比赛日程——HMMT 2025 年 2 月 15 日举办,数天内模型分数就已上线,抢在任何厂商把新题喂进训练数据之前完成。
典型任务
以 HMMT 2025 年 2 月几何轮第 1 题为例:矩形 ABCD 中 BC=24,内部一点 X 满足 ∠AXB=90°,已知 △AXD 和 △BXC 都是锐角三角形且外接圆半径分别为 13 和 15,求 AB 的长度——官方答案 14+4√37,需要作对称点加圆幂定理才能解出。组合轮第 1 题则要求计算把 1 到 7 这七个数排成一圈、满足特定相邻条件的排法数。题面都很短,但多数题需要竞赛技巧而非直接套公式。
分数怎么看
在 MathArena 榜单上,HMMT February 2025 长期比同年 AIME 更难,同一模型在 HMMT 上的得分通常明显低于 AIME 2025。分数随模型迭代变化很快,以 matharena.ai 实时榜单为准;2025 年下半年头部模型(如 GPT-5)在最终答案型赛事整体上已到约 90%。
含金量与局限
题量小(每场 30 题),方差大;赛事本身是学生组织办的,基准化是第三方(MathArena)行为,不同平台或厂商自报可能用不同子集、不同采样次数,横向对比要看清协议;只判最终答案,证明类能力测不到。
冷知识
HMMT 的价值全在一个「快」字:题目周六公布,模型下周就被拉进考场,抢在任何厂商来得及把新题喂进训练数据之前。它本质上是一场命题人与训练流水线之间的赛跑。
数据来源
本页由仓库 content/benchmarks/hmmt.md 初始化。后续修订通过公开审核队列发布。