跳转到内容

测试集:USAMO

来自封神榜 Wiki
名称 USAMO
类别 reasoning
主办方 MAA;标志性基准论文为 ETH SRI × INSAIT《Proof or Bluff?》(arXiv:2503.21934)
开源状态 partial
网址 官方页面

usamo25美国奥数证明题、专家人工评分、0-7 分制、打击猜答案、一次性评测无持续榜

测试集content/benchmarks/usamo.md

一句话

美国数学奥林匹克证明题,专治「蒙对答案」

测什么

USAMO(美国数学奥林匹克)是 MAA 主办的顶级中学生赛事,两天六题,全是要求完整书写证明的大题,也是美国 IMO 国家队选拔的关键一环。作为 AI 基准,标志性工作是 ETH SRI 与 INSAIT 的论文《Proof or Bluff?》:研究者在 2025 年 USAMO 赛题公布后数小时内,让当时最强的六个推理模型(o1-pro、o3-mini、R1、QwQ、Claude 3.7、Gemini Flash-Thinking、Gemini-2.5-Pro)作答,检验它们写证明——而不是猜最终答案——的真实水平。

怎么测

模型对每道题生成完整证明,每题独立跑 4 次;由 4 位有竞赛经验的专家评委按官方 0–7 分制人工打分(7 分代表完整正确的证明,部分步骤给部分分),满分 42 分。评委还逐份评注,归纳模型的典型失败模式。这套流程昂贵但换来的信息量是最终答案型评测给不了的。

典型任务

结果触目惊心:只有 Gemini-2.5-Pro 拿到约 25% 的分数,其余模型全部低于 5%——而同一批模型在 AIME 上已能比肩顶尖人类选手。论文把典型失败称为「bluff」:模型写出看似流畅实则空洞的证明,比如宣称「由某著名定理即得」但该定理并不存在或不适用、举几个具体例子就断言一般结论成立、在关键逻辑跳跃处用「显然」一笔带过,全程语气自信,非专家很难分辨真假。

分数怎么看

这个评测第一次系统证明:「答对」和「证对」之间隔着巨大的能力鸿沟。它是 2025 年衡量模型数学严谨性的标志性参照,也直接催生了后续对证明型评测(IMO、MathArena 证明轨道)的重视。

含金量与局限

人工专家评分昂贵且难以规模化复现,每模型只有 6 题×4 次共 24 份样本,统计上很薄;这是 2025 年 3 月某一代模型的快照,此后 IMO 2025 金牌级系统已明显进步,旧结论不能直接外推到新模型。

冷知识

论文标题本身就是一句质问:Proof or Bluff?评委发现模型不仅证明写得「虚」,还会煞有介事地引用并不存在的「著名定理」、举两个例子就宣布一般结论成立——语气自信到非专家几乎分辨不出真假。

数据来源

本页由仓库 content/benchmarks/usamo.md 初始化。后续修订通过公开审核队列发布。