测试集:IMO 2025
| 名称 | IMO 2025 |
|---|---|
| 类别 | reasoning |
| 主办方 | 国际数学奥林匹克(第 66 届,2025-07);AI 评测方为 Google DeepMind 与 OpenAI |
| 开源状态 | partial |
| 网址 | 官方页面 |
imo-202583.3正式奥数赛制、4.5 小时限时、自然语言证明、官方协调员认证、一次性事件
测试集content/benchmarks/imo-2025.md
一句话
2025 国际奥数赛场,两大 AI 同达金牌线
测什么
国际数学奥林匹克(IMO)是全球最高水平的中学生数学竞赛,两天做 6 道证明题,每题 0–7 分、满分 42,通常只有约 8% 的选手能过金牌线。2025 年 7 月的第 66 届意外成为 AI 的「世纪考场」:Google DeepMind 的 Gemini Deep Think 高级版和 OpenAI 的实验性推理模型先后宣布拿到 35/42——正好压在金牌线上。这是 AI 首次在 IMO 正式规则下达到金牌水平。
怎么测
两边都让模型在与人类选手相同的 4.5 小时时限内,直接读自然语言题面、输出自然语言完整证明,不借助形式化证明工具。Google 的答卷由 IMO 官方协调员按学生答卷同一标准认证;OpenAI 未走官方渠道,而是自行组织前 IMO 奖牌得主评分,其独立性当时引发了争议。
典型任务
第 1 题定义「阳光线」:不平行于 x 轴、y 轴和直线 x+y=0 的直线;要求确定所有非负整数 k,使得存在 n 条直线覆盖所有满足 a+b≤n+1 的格点 (a,b)、且其中恰好 k 条是阳光线。第 6 题「Matilda 铺砖」是全场最难题:在 2025×2025 方格里放矩形瓷砖,使每行每列恰好留出一个空格,求最少要多少块(答案 2112)——MathArena 后来把它改成最终答案题测试,81% 的模型答 4048 并附上一段假证明。Gemini 六题中五题拿了满分。
分数怎么看
35/42 是里程碑:它证明顶级推理系统已能在最严的人类数学赛制下与金牌选手同台。但注意这是一次性事件而非持续榜单——每年题目不同,分数无法跨年比较,2025 年的 35 分和 2026 年的成绩没有可比性。
含金量与局限
OpenAI 的成绩未获 IMO 官方认证,其评分独立性和抢在官方日程前官宣的做法均有争议;两套系统都是未公开的实验版本,外界无法复现;单次六题的结果不应外推为「AI 数学能力全面超越人类」——同年 USAMO 式的人工评阅早就揭示过模型证明里的水分。
冷知识
两家 AI 的分数一模一样:35/42,正好压金牌线,一分都不浪费。而全场最难的第 6 题「Matilda 铺砖」后来被 MathArena 改成数值题复测,81% 的模型给出同一个错误答案 4048 并配上假证明——这道题的绰号干脆就叫「Final Boss」。
数据来源
本页由仓库 content/benchmarks/imo-2025.md 初始化。后续修订通过公开审核队列发布。