测试集:MathArena Apex
| 名称 | MathArena Apex |
|---|---|
| 类别 | reasoning |
| 主办方 | ETH SRI × INSAIT(MathArena 平台,2025-08) |
| 开源状态 | partial |
| 网址 | 官方页面 |
matharena-apex5.212 道无人能解题、16 次采样报均率、按解不出筛题、题源跨赛事、排名无参考价值
测试集content/benchmarks/matharena-apex.md
一句话
从全年赛事筛出的 12 道「无人能解」数学题
测什么
MathArena Apex 是 MathArena 平台 2025 年 8 月推出的精选难题集,动机很直接:头部模型(如 GPT-5)在各最终答案型赛事上已约 90%,常规竞赛题快不够考了。于是作者翻遍 2025 年近 100 场公开数学竞赛,用四个前沿模型(Grok 4、GPT-5 High、Gemini 2.5 Pro、GLM 4.5)各试 4 次做过滤器——只要有任何一次答对就淘汰,最终只有 12 题幸存。其中 6 题来自最终答案型赛事(SMT、EMCC、CMM),6 题由证明题(IMO、各国队选拔赛)在不降低难度的前提下改写成最终答案形式。
怎么测
评测时 9 个模型每题独立采样 16 次,报全部题目、全部尝试的平均成功率;另有一个带自我验证反馈循环的 GPT-5 Agent 变体跑 4 次作参照。因为题目就是按「这些模型解不出」挑的,分数天然极低,作者也明言模型间的排名没有参考价值。题目选入时保证未污染(模型发布前题未公开或不构成训练目标),平台会随新赛事持续补充新题。
典型任务
第 1 题「整数弦」(全俄竞赛 2025):连续函数 f 的图像上恰有 N 条长度为整数且平行于 x 轴的弦,其中一条长 2025,求 N 的最小值——正确答案 4049,但 45% 的模型尝试错答 2025,只有 Qwen3-Thinking 在 16 次中答对 7 次。第 12 题「IMO 终极大魔王」由 IMO 2025 第 6 题改写:2025×2025 方格铺矩形砖、每行每列恰留一个空格,求最少块数(答案 2112)——81% 的尝试答 4048 并附上假证明,无一答对。还有一道 SMT 几何题看着简单实则藏陷阱,所有模型 100% 给出同一个错误答案 4π。
分数怎么看
最高分 Qwen3-235B-Thinking 仅 5.2%,12 题里最难的第 9–12 题所有模型 16 次尝试全灭。它回答的问题是「竞赛数学还能难倒 AI 吗」——截至 2025 年 8 月,答案是能,但只剩十几道题的量级。分数会随新模型、新题目快速变化,以 matharena.ai/apex 页面为准。
含金量与局限
只有 12 题,统计意义有限,作者自己警告不要拿排名说事;部分题目在被测模型发布前已公开,目前评估认为污染尚不构成问题,但随题目被当作训练目标的风险会增加;3 道 SMT 题目因主办方要求未公开;题源与 MathArena 的 HMMT/AIME 2025 评测存在重叠。
冷知识
第 9 题是道「看着简单」的 SMT 几何题,所有模型 100% 给出同一个错误答案 4π——MathArena 作者承认自己初做时也犯了完全一样的错,直到把曲线画出来才发现问题,而模型没法画图。
数据来源
本页由仓库 content/benchmarks/matharena-apex.md 初始化。后续修订通过公开审核队列发布。