跳转到内容

测试集:HMMT

来自封神榜 Wiki
名称 HMMT
类别 reasoning
主办方 哈佛/MIT 学生组织;基准化由 MathArena(ETH SRI)赛后数天内完成
开源状态 open
网址 官方页面

hmmt90哈佛-MIT 赛事真题、赛后数天即测、题目防污染、精确匹配判分、难度高于 AIME

测试集content/benchmarks/hmmt.md

一句话

哈佛-MIT 数学赛真题,赛后立刻开测防背题

测什么

HMMT 是哈佛和 MIT 学生组织合办的高水平数学竞赛,每年 2 月、11 月各一场,个人赛按代数、组合、几何、数论分轮次,题目一律要求给出最终答案(数值或表达式)。作为 AI 基准,它由 MathArena(苏黎世联邦理工 SRI 实验室)在赛后数天内把新题整理上线评测,最常用的是 HMMT February 2025 的 30 题。它的核心价值是「新鲜」:题目在模型训练数据截止之后才公开,从机制上排除背题的可能,难度又普遍高于 AIME。

怎么测

按 MathArena 协议评测:模型逐题独立作答,输出完整推理和最终答案,与官方答案精确匹配判分;每题采样多次(通常 4 次起)报平均正确率。评测紧跟比赛日程——HMMT 2025 年 2 月 15 日举办,数天内模型分数就已上线,抢在任何厂商把新题喂进训练数据之前完成。

典型任务

以 HMMT 2025 年 2 月几何轮第 1 题为例:矩形 ABCD 中 BC=24,内部一点 X 满足 ∠AXB=90°,已知 △AXD 和 △BXC 都是锐角三角形且外接圆半径分别为 13 和 15,求 AB 的长度——官方答案 14+4√37,需要作对称点加圆幂定理才能解出。组合轮第 1 题则要求计算把 1 到 7 这七个数排成一圈、满足特定相邻条件的排法数。题面都很短,但多数题需要竞赛技巧而非直接套公式。

分数怎么看

在 MathArena 榜单上,HMMT February 2025 长期比同年 AIME 更难,同一模型在 HMMT 上的得分通常明显低于 AIME 2025。分数随模型迭代变化很快,以 matharena.ai 实时榜单为准;2025 年下半年头部模型(如 GPT-5)在最终答案型赛事整体上已到约 90%。

含金量与局限

题量小(每场 30 题),方差大;赛事本身是学生组织办的,基准化是第三方(MathArena)行为,不同平台或厂商自报可能用不同子集、不同采样次数,横向对比要看清协议;只判最终答案,证明类能力测不到。

冷知识

HMMT 的价值全在一个「快」字:题目周六公布,模型下周就被拉进考场,抢在任何厂商来得及把新题喂进训练数据之前。它本质上是一场命题人与训练流水线之间的赛跑。

数据来源

本页由仓库 content/benchmarks/hmmt.md 初始化。后续修订通过公开审核队列发布。