跳转到内容

测试集:GraphWalks

来自封神榜 Wiki
名称 GraphWalks
类别 other
主办方 OpenAI,2025 开源(MIT),HF: openai/graphwalks
开源状态 open
网址 官方页面

graphwalks99.7超长上下文图推理、BFS/Parents 变体、F1 判分、按长度分桶、合成数据

测试集content/benchmarks/graphwalks.md

一句话

把一张大图塞进超长上下文,让 AI 在脑子里跑 BFS

测什么

OpenAI 开源的超长上下文多跳推理基准。它不像「大海捞针」那样只要找到一句话,而是把整个上下文填成一张有向图——节点是十六进制哈希串、边以列表形式平铺——然后要求模型在图上做真正的算法操作:从某个节点出发做广度优先遍历(BFS),或反查某节点的所有父节点(Parents)。答对需要在几十万 token 的边列表里反复跳转、维护遍历状态,考的是长上下文里的主动推理而非被动检索。数据集共 1150 个实例,按上下文长度分桶。

怎么测

每条 prompt 含 3 个演示样例、一张目标图(边列表)和一个查询,模型要输出节点 ID 列表。判分用官方配套的答案抽取和 F1 评分脚本(输出集合与标准答案算 F1,允许部分对)。常报 BFS 和 Parents 两个变体,各自按 128k/256k/1M 长度分桶。Anthropic 在自家评测中发现标准答案常为空集而官方脚本会给 0 分,对评分逻辑做过修正——这说明各家跑出来的分数可能因判分细节有差。

典型任务

一个具体任务长这样:prompt 里是几百上千行形如「3fa9c1 → 77b2e0」的边,然后问「从节点 3fa9c1 出发做 BFS,按访问顺序列出所有可达节点」。模型得在脑内(或草稿里)维护队列和已访问集合,逐层扩展——漏看一条边、记错一个已访问节点,整趟遍历就错了。Parents 变体则是反向操作:给出某个节点,列出所有指向它的父节点,需要对整个边列表做反向扫描。

分数怎么看

按 F1 计分、越高越好,且必须带长度档看:128k 上接近满分不代表 1M 上行得通。第三方收录显示 GPT-5.2 High 在 BFS 128k 档约 99.7%,而 1M 档头部模型分数明显回落(如 GPT-5.5 的 BFS 1M F1 约 57%),长桶依然是分水岭。

含金量与局限

图是程序生成的合成数据,污染风险低,但「读哈希串走图」和现实长文本应用有距离,分数高不等于长文档理解好。各厂商上报时的判分细节(如空答案集的处理)未必一致,跨模型对比要留意口径;站内「GraphWalks BFS」标签即本条的 BFS 变体。

冷知识

Anthropic 跑榜时抓到一个判分 bug:很多题的标准答案其实是空集(该节点没有父节点),而官方脚本在标准答案为空时直接记 0 分——模型「正确地说出没有」反而不得分,Anthropic 只能在系统卡里注明自己改了评分逻辑。

数据来源

本页由仓库 content/benchmarks/graphwalks.md 初始化。后续修订通过公开审核队列发布。