跳转到内容

测试集:BrowseComp

来自封神榜 Wiki
名称 BrowseComp
类别 agent
主办方 OpenAI,2025-04 随 Deep Research 发布(arXiv:2504.12516)
开源状态 open
网址 官方页面

browsecomp51.51,266 道倒装出题冷门事实题、自主联网搜索多轮检索、AI grader 语义比对判分、三道难度门槛(前沿模型做不出 + 五搜无果 + 人类十分钟做不出)、canary 标记防训练污染

测试集content/benchmarks/browsecomp.md

一句话

考 AI 大海捞针:翻遍全网找一条冷门事实

测什么

测浏览 agent「找藏得深但好验证的信息」的能力,1,266 道题。出题方式是「倒装」:出题人先锁定一个冷门事实(一个人、一场比赛、一篇论文),再挑出它的一组属性反过来说成谜面,让答案在理论上唯一、但几乎搜不到。这样的设计故意避开了日常搜索——答案是那种「Google 第一页绝对没有、但找到了一眼能确认」的东西,专测检索的毅力和策略,而不是知识储备。

怎么测

agent 带着问题自主上网,可以反复搜索、翻页、换关键词,最后交一个简短答案。参考答案都是短字符串,判分用一个 AI grader(与 Humanity's Last Exam 同一套判分 prompt)判断模型答案与参考答案是否语义等价,报准确率。出题时有三道难关把关:当时的 GPT-4o、o1 和早期 Deep Research 都答不出;简单搜五次首页没有;另一个人十分钟内也做不出。

典型任务

论文给的例子很有画面感:「1990 到 1994 年间,哪两支球队的足球比赛由巴西裁判执法、全场四张黄牌双方各两张、其中三张不出现在上半场、四次换人且一次是前 25 分钟因伤换人?」(答案:Ireland v Romania)。另一题:「找出这位虚构角色——偶尔打破第四面墙、背景故事里有无私的苦行僧相助、以幽默著称、主演的电视剧在 60 到 80 年代播出且不到 50 集」(答案:Plastic Man)。解题得把条件拆开、设计搜索路径、交叉验证, brute force 要翻成千上万个候选。

分数怎么看

发布时的数字很有冲击力:GPT-4o 不开浏览只有 0.6%,开了浏览也才 1.9%,OpenAI Deep Research 约 51.5%——是当时唯一能做这个榜的系统,也成了各家 deep research 产品的必争之地。连出题的人类训练师自己做(不许用 AI、两小时上限)也只解出 29.2%。

含金量与局限

它只测「找到一条难找的信息」,不测写长报告、处理模糊需求等真实搜索场景。倒装出题有固有缺陷:能保证参考答案对,但不能百分百保证没有第二个答案。题目和参考答案公开后污染风险上升(官方加了 canary 字符串过滤训练语料),且网页内容随时间变化会影响可解性;衍生版(BrowseComp-ZH、MM-BrowseComp 等)成绩与原始版不可混用。

冷知识

数据集里埋了一串 canary 标记「browsecomp:26b5c67b-…」,方便各家从训练语料里把它过滤掉;论文还公开请求读者不要在网上明文贴题目,防的就是被训练数据吸收或被评测 agent 直接搜到答案。

数据来源

本页由仓库 content/benchmarks/browsecomp.md 初始化。后续修订通过公开审核队列发布。