测试集:USAMO
| 名称 | USAMO |
|---|---|
| 类别 | reasoning |
| 主办方 | MAA;标志性基准论文为 ETH SRI × INSAIT《Proof or Bluff?》(arXiv:2503.21934) |
| 开源状态 | partial |
| 网址 | 官方页面 |
usamo25美国奥数证明题、专家人工评分、0-7 分制、打击猜答案、一次性评测无持续榜
测试集content/benchmarks/usamo.md
一句话
美国数学奥林匹克证明题,专治「蒙对答案」
测什么
USAMO(美国数学奥林匹克)是 MAA 主办的顶级中学生赛事,两天六题,全是要求完整书写证明的大题,也是美国 IMO 国家队选拔的关键一环。作为 AI 基准,标志性工作是 ETH SRI 与 INSAIT 的论文《Proof or Bluff?》:研究者在 2025 年 USAMO 赛题公布后数小时内,让当时最强的六个推理模型(o1-pro、o3-mini、R1、QwQ、Claude 3.7、Gemini Flash-Thinking、Gemini-2.5-Pro)作答,检验它们写证明——而不是猜最终答案——的真实水平。
怎么测
模型对每道题生成完整证明,每题独立跑 4 次;由 4 位有竞赛经验的专家评委按官方 0–7 分制人工打分(7 分代表完整正确的证明,部分步骤给部分分),满分 42 分。评委还逐份评注,归纳模型的典型失败模式。这套流程昂贵但换来的信息量是最终答案型评测给不了的。
典型任务
结果触目惊心:只有 Gemini-2.5-Pro 拿到约 25% 的分数,其余模型全部低于 5%——而同一批模型在 AIME 上已能比肩顶尖人类选手。论文把典型失败称为「bluff」:模型写出看似流畅实则空洞的证明,比如宣称「由某著名定理即得」但该定理并不存在或不适用、举几个具体例子就断言一般结论成立、在关键逻辑跳跃处用「显然」一笔带过,全程语气自信,非专家很难分辨真假。
分数怎么看
这个评测第一次系统证明:「答对」和「证对」之间隔着巨大的能力鸿沟。它是 2025 年衡量模型数学严谨性的标志性参照,也直接催生了后续对证明型评测(IMO、MathArena 证明轨道)的重视。
含金量与局限
人工专家评分昂贵且难以规模化复现,每模型只有 6 题×4 次共 24 份样本,统计上很薄;这是 2025 年 3 月某一代模型的快照,此后 IMO 2025 金牌级系统已明显进步,旧结论不能直接外推到新模型。
冷知识
论文标题本身就是一句质问:Proof or Bluff?评委发现模型不仅证明写得「虚」,还会煞有介事地引用并不存在的「著名定理」、举两个例子就宣布一般结论成立——语气自信到非专家几乎分辨不出真假。
数据来源
本页由仓库 content/benchmarks/usamo.md 初始化。后续修订通过公开审核队列发布。