跳转到内容

测试集:GPQA Diamond

来自封神榜 Wiki
名称 GPQA Diamond
类别 reasoning
主办方 NYU / Cohere / Anthropic 研究者(David Rein 等),arXiv:2311.12022,COLM 2024
开源状态 open
网址 官方页面

gpqa-diamond94.9博士级理化生四选一、198 题 Diamond 子集、谷歌搜不到答案、选项乱序+多次采样、专家基线 65%

测试集content/benchmarks/gpqa-diamond.md

一句话

博士级理化生选择题,谷歌也搜不到答案

测什么

GPQA 全称 Graduate-Level Google-Proof Q&A,由 NYU 等机构的研究生发布,包含 448 道生物、化学、物理三个领域的博士级四选一题,全部由对应领域的博士级专家亲自编写。设计目标是「谷歌也救不了你」:让非本领域的高水平验证者开卷用搜索引擎查 30 分钟以上,正确率也只有约 34%,而本领域专家约 65%(剔除自认的笔误后 74%)。Diamond 是从中再筛出的 198 题——专家答得对、非专家大多答错的那批,是公认最难的子集,也是今天厂商报分默认用的版本。它针对的是「模型是否具备专家级科学推理」这一能力,而不是事实检索。

怎么测

模型拿到题干和四个选项,输出选项字母,按准确率计分。主流评测脚本(如 OpenAI simple-evals)会把选项顺序随机打乱,并且每题重复采样 4 次取平均,以降低选项位置带来的噪声。人类基线就是前面那组数字:专家约 65–74%,非专家约 34%,瞎蒙下限 25%。

典型任务

论文给出的样题以一段具体科研情境开头(例如一道分子生物学题描述一位科学家的实验设置),随后给出四个都貌似合理的选项——三个干扰项同样按「能骗过聪明外行」的标准设计,必须真正懂该领域的机制和计算才能排除。值得注意的是,数据集作者明确要求不要在网上明文贴出原题,以防泄进训练语料,所以公开渠道几乎看不到完整题目,只能看到学科分布、评测脚本和各家分数。

分数怎么看

GPT-4 时代最强基线只有 39%,远低于专家;推理模型出现后分数快速攀升,如今前沿模型普遍超过专家基线,80% 以上算头部水平。它是判断「模型科学推理是否逼近博士专家」最常用的试金石之一,厂商发布新模型几乎必报。

含金量与局限

只有 198 题,统计噪声不小,一两个点的分差意义有限;题目虽有保密要求,但答案片段难免在网上流传,污染风险长期存在;Epoch AI 等第三方复现的分数与厂商自报常有出入,横向对比要认准同一评测口径。选择题形式也决定了它测不了完整的推导过程。

冷知识

GPQA 是最早把「防背题」写进设计的主流基准之一:数据集内置 canary 字符串用于侦测训练语料泄漏,作者还公开请求所有人不要在网上贴原题。名字本身就是卖点——Google-Proof,谷歌也搜不到答案。

数据来源

本页由仓库 content/benchmarks/gpqa-diamond.md 初始化。后续修订通过公开审核队列发布。