跳转到内容

测试集:GDPval

来自封神榜 Wiki
名称 GDPval
类别 arena
主办方 OpenAI,2025-09 发布(arXiv:2510.04374)
开源状态 partial
网址 官方页面

gdpval84.944 种职业 × 9 大 GDP 行业,1320 个真实工作任务、资深专家编写(平均从业 14 年),交付真实工作产物(文档/PPT/图纸/表格)、同行专家盲评 win/tie 率;AA 版为 Elo 复跑、一次性单轮任务,不含与客户来回沟通迭代、gold 220 题开源子集 + 公开评分服务输入值为“44 种职业 × 9 大 GDP 行业,1320 个真实工作任务、资深专家编写(平均从业 14 年),交付真实工作产物(文档/PPT/图纸/表格)、同行专家盲评 win/tie 率;AA 版为 Elo 复跑、一次性单轮任务,不含与客户来回沟通迭代、gold 220 题开源子集 + 公开评分服务”的属性“特征”(作为页面类型)含有无效字符或不完整,因此会在查询或注解过程中导致预期外结果。

测试集content/benchmarks/gdpval.md

一句话

让 AI 干 44 种职业的真活,专家盲评比人强还是差

测什么

OpenAI 提出的「真实经济价值」评测:学术考试离日常上班太远,干脆按 GDP 挑活——选对美国 GDP 贡献最大的 9 个行业,每个行业挑 5 个左右以知识工作为主、薪酬贡献大的职业,共 44 种(律师、注册护士、机械工程师、软件开发、会计师、药剂师、记者……)。每职业 30 个真实工作任务,共 1320 题,其中 220 题组成开源 gold 子集。任务由平均从业 14 年的资深专家撰写、平均经 5 轮审核;人类专家做一题平均要花约 7 小时。模型要交的不是一段话,而是真正的交付物:文档、PPT、图纸、电子表格甚至多媒体。

怎么测

模型拿到任务说明加参考文件(不只是文字提示),产出交付文件。评分靠同行业专家盲评:评分员不知道哪份是人做的、哪份是 AI 做的,两两对比判「优于 / 相当 / 逊于」,汇总成 win/tie 率。OpenAI 还训练了自动评分器并公开在 evals.openai.com,但官方自承可靠性不及人类专家,只作研究用途。衍生版 GDPval-AA 是 Artificial Analysis 用自己的沙箱流程复跑:模型在 E2B 沙箱里带工具做任务,三家前沿模型评审团盲评,拟合成锚定「人类专家 = 1000」的 Elo,v2 为当前版本。

典型任务

官方示例题:你是汽车产线上的制造工程师,产品是一台地下采矿用的电缆卷盘车,终检环节要两人配合把电缆收放两遍——一人扶着卷盘转动,一人接线操作,又累又危险。经理要求你设计一个工装夹具,让一个人就能完成测试。附件给了卷盘尺寸等技术资料,你要用 3D 建模设计夹具,最终只交一份 PDF 概念设计汇报(附建模截图)。其他题形如撰写法律文书、画工程蓝图、制定护理计划、分析客户支持对话。

分数怎么看

首批官方结果(2025-09,gold 220 题):Claude Opus 4.1 表现最好,近半数任务的交付物被专家评为与人类相当或更好,尤其在排版、PPT 布局等美学维度;GPT-5 胜在领域知识准确性。官方还称前沿模型做这些任务约比专家快 100 倍、成本约 1%——但只算了模型推理时间和 API 费,没算人工监督与集成。

含金量与局限

OpenAI 自己做的榜、自己的模型也在榜上,独立性天然打折;且为一次性单轮任务,不含真实工作里与客户来回沟通、按反馈迭代的部分,官方在论文中也承认这是初版的主要局限。任务全部基于美国职业语境。别名中的 GDPval-AA 是第三方复跑版,评分口径(Elo vs win/tie 率)与原版不同,两者分数不可直接换算。

冷知识

按官方披露的成长曲线,模型对人类专家的 win/tie 率从 GPT-4o(2024-05)的 12.4% 一路涨到 GPT-5.5 的约 84.9%,不到两年翻了将近 7 倍。OpenAI 还坦白做过一次「开卷实验」:对内部实验版 GPT-5 做增量训练专刷 GDPval,确认分数可以被定向优化。

数据来源

本页由仓库 content/benchmarks/gdpval.md 初始化。后续修订通过公开审核队列发布。