跳转到内容

测试集:MathArena Apex

来自封神榜 Wiki
名称 MathArena Apex
类别 reasoning
主办方 ETH SRI × INSAIT(MathArena 平台,2025-08)
开源状态 partial
网址 官方页面

matharena-apex5.212 道无人能解题、16 次采样报均率、按解不出筛题、题源跨赛事、排名无参考价值

测试集content/benchmarks/matharena-apex.md

一句话

从全年赛事筛出的 12 道「无人能解」数学题

测什么

MathArena Apex 是 MathArena 平台 2025 年 8 月推出的精选难题集,动机很直接:头部模型(如 GPT-5)在各最终答案型赛事上已约 90%,常规竞赛题快不够考了。于是作者翻遍 2025 年近 100 场公开数学竞赛,用四个前沿模型(Grok 4、GPT-5 High、Gemini 2.5 Pro、GLM 4.5)各试 4 次做过滤器——只要有任何一次答对就淘汰,最终只有 12 题幸存。其中 6 题来自最终答案型赛事(SMT、EMCC、CMM),6 题由证明题(IMO、各国队选拔赛)在不降低难度的前提下改写成最终答案形式。

怎么测

评测时 9 个模型每题独立采样 16 次,报全部题目、全部尝试的平均成功率;另有一个带自我验证反馈循环的 GPT-5 Agent 变体跑 4 次作参照。因为题目就是按「这些模型解不出」挑的,分数天然极低,作者也明言模型间的排名没有参考价值。题目选入时保证未污染(模型发布前题未公开或不构成训练目标),平台会随新赛事持续补充新题。

典型任务

第 1 题「整数弦」(全俄竞赛 2025):连续函数 f 的图像上恰有 N 条长度为整数且平行于 x 轴的弦,其中一条长 2025,求 N 的最小值——正确答案 4049,但 45% 的模型尝试错答 2025,只有 Qwen3-Thinking 在 16 次中答对 7 次。第 12 题「IMO 终极大魔王」由 IMO 2025 第 6 题改写:2025×2025 方格铺矩形砖、每行每列恰留一个空格,求最少块数(答案 2112)——81% 的尝试答 4048 并附上假证明,无一答对。还有一道 SMT 几何题看着简单实则藏陷阱,所有模型 100% 给出同一个错误答案 4π。

分数怎么看

最高分 Qwen3-235B-Thinking 仅 5.2%,12 题里最难的第 9–12 题所有模型 16 次尝试全灭。它回答的问题是「竞赛数学还能难倒 AI 吗」——截至 2025 年 8 月,答案是能,但只剩十几道题的量级。分数会随新模型、新题目快速变化,以 matharena.ai/apex 页面为准。

含金量与局限

只有 12 题,统计意义有限,作者自己警告不要拿排名说事;部分题目在被测模型发布前已公开,目前评估认为污染尚不构成问题,但随题目被当作训练目标的风险会增加;3 道 SMT 题目因主办方要求未公开;题源与 MathArena 的 HMMT/AIME 2025 评测存在重叠。

冷知识

第 9 题是道「看着简单」的 SMT 几何题,所有模型 100% 给出同一个错误答案 4π——MathArena 作者承认自己初做时也犯了完全一样的错,直到把曲线画出来才发现问题,而模型没法画图。

数据来源

本页由仓库 content/benchmarks/matharena-apex.md 初始化。后续修订通过公开审核队列发布。