跳转到内容

测试集:AIME

来自封神榜 Wiki
名称 AIME
类别 reasoning
主办方 美国数学协会(MAA);基准数据集常用 HuggingFaceH4/aime_2024、math-ai/aime25
开源状态 open
网址 官方页面

aime95.8真实竞赛真题、0–999 整数答案、每年仅 30 题、采样取平均报分、2024 真题有污染

测试集content/benchmarks/aime.md

一句话

美国奥数邀请赛真题,答案都是 0–999 整数

测什么

AIME(美国数学邀请赛)是 MAA 主办的赛事,夹在 AMC 和 USAMO 之间——AMC 考得足够好才有资格参加,全国高中生里大约前 5% 能走到这一步。每年两场(AIME I/II)各 15 题共 30 题,覆盖代数、几何、数论、组合与概率,所有答案都是 0 到 999 的整数。这个「整数答案」设计让它天然适合自动判分,社区于是把历年真题整理成数据集测模型,最常用的是 2024、2025 年份。它针对的是竞赛级多步数学推理。

怎么测

模型拿到题目原文,自由输出推理过程,最后给出一个整数,与官方答案精确匹配判对错。真实考试给选手 3 小时、不许用计算器。因为一年只有 30 题、随机波动大,通行做法是每题采样几十次(常见 32 或 64 次)再取平均,报 avg@k 而不是单次正确率——看分数时一定要留意采样次数。

典型任务

比如 2024 AIME II 第 1 题:Aimeville 镇 900 名居民中,195 人有钻戒、367 人有高尔夫球杆、562 人有园铲,且人人都有一袋心形糖果;已知 437 人恰好拥有其中两样、234 人恰好拥有三样,求四样全有的人数——用容斥原理列方程,答案是 73。中等难度的如 2024 AIME I 第 13 题:找最小的素数 p 使存在整数 n 满足 p² 整除 n⁴+1(p=17),再求最小的正整数 m 使 p² 整除 m⁴+1,答案 110。题目往往一句话就能读懂,但要做对得绕好几个弯。

分数怎么看

2024 年初 GPT-4 类模型基本做不动,推理模型时代分数暴涨:头部模型在 AIME 2024 上普遍超过 90%,在更新的 AIME 2025 上最好成绩也在九成上下(MathArena 2025 年 8 月称 GPT-5 在其所有最终答案型赛事上都约 90%)。低于 50% 在今天只能算二线水平。

含金量与局限

一年只有 30 题,差一两题分数就抖动 3–7 个百分点,单次跑分参考价值有限;早年份真题在训练语料里泛滥,AIME 2024 的分数普遍被认为有污染,看最新年份才可靠;只判最终整数,推理过程错了但数字蒙对也算对——USAMO/IMO 类证明题正是为补这个洞而生。

冷知识

2024 年 AIME II 第 1 题把小镇命名为「Aimeville」——命题人直接把赛事名字埋进了题面。答案限定 0–999 整数源于真实答题卡:选手涂的是三位数字的圆圈,这套几十年前的设计意外成了自动判分的完美接口。

数据来源

本页由仓库 content/benchmarks/aime.md 初始化。后续修订通过公开审核队列发布。