跳转到内容

测试集:SuperGPQA

来自封神榜 Wiki
名称 SuperGPQA
类别 reasoning
主办方 字节豆包团队 × M-A-P(2077.AI),arXiv:2502.14739(2025-02)
开源状态 open
网址 官方页面

supergpqa73.8285 研究生学科、2.6 万题单选题、最多 10 选项、人机协作过滤、学科细分报告

测试集content/benchmarks/supergpqa.md

一句话

285 个研究生学科、2.6 万题的广度大考

测什么

SuperGPQA 把 GPQA「博士级难题」的思路从理化生三科扩展到 285 个研究生二级学科:13 大学科门类、72 个一级学科、26,529 道题,每个学科至少 50 题。它专门覆盖农学、军事学、教育学这类传统 benchmark 几乎不碰的长尾学科(约 77% 仍是 STEM,其中工程学 7892 题、理学 9838 题),约 42% 的题需要计算。出题采用「人机协作过滤」:80 多位专家标注员结合多轮 LLM 答题反馈,反复剔除太简单或有歧义的题,只留下能卡住模型的。

怎么测

每题是最多 10 个选项(A–J,平均 9.67 个)的单选题,模型选出唯一正确项,按准确率计分。官方评测支持 zero-shot 和 five-shot 两种模式,并提供按学科门类、按难度(易/中/难)拆分的细分准确率,方便看模型的短板到底在哪个领域。报分时最常见的是 overall 准确率。

典型任务

题目形式很统一:题干平均约 58 个 token、选项平均约 13 个 token,比如一道军事学或农学题给出一段专业情境,随后列出 A 到 J 十个候选,模型必须从中挑出唯一正确项;理工类则有相当比例要先推导计算、再从十个数值选项里挑答案。题目主体是新写的,但官方 README 注明有一小部分由既有数据集改造而来(包括 MMLU-Pro、MedQA、LawBench、AIME-AOPS 等),使用时需遵守原数据集协议。

分数怎么看

发布时(2025 年 2 月)最强推理模型 DeepSeek-R1 也只有 61.82%,o1 为 60.24%,普通对话模型普遍在 40–55%——60% 上下曾是前沿水平线。官方榜单持续更新,新一代模型已到 70% 以上(如 Gemini 3 Pro 约 73.8%)。分数低不代表模型差,而是长尾学科知识本来就难。

含金量与局限

体量大但摊到单学科题量小,细分学科层面的分数噪声大;部分题目源自公开数据集改造,存在污染可能;十个选项把蒙对率压到约 10%,但选择题终究测不了完整推导;作为 GPQA 的「广度互补版」,它测知识覆盖多于测深度推理。

冷知识

榜单的学科细分里能看到不少「偏科现场」:有模型在农学、军事学等长尾学科直接 0 分出局。另外,十个选项的设计把瞎蒙命中率压到约 10%——比四选一的 25% 难混得多。

数据来源

本页由仓库 content/benchmarks/supergpqa.md 初始化。后续修订通过公开审核队列发布。