测试集:GraphWalks
| 名称 | GraphWalks |
|---|---|
| 类别 | other |
| 主办方 | OpenAI,2025 开源(MIT),HF: openai/graphwalks |
| 开源状态 | open |
| 网址 | 官方页面 |
graphwalks99.7超长上下文图推理、BFS/Parents 变体、F1 判分、按长度分桶、合成数据
测试集content/benchmarks/graphwalks.md
一句话
把一张大图塞进超长上下文,让 AI 在脑子里跑 BFS
测什么
OpenAI 开源的超长上下文多跳推理基准。它不像「大海捞针」那样只要找到一句话,而是把整个上下文填成一张有向图——节点是十六进制哈希串、边以列表形式平铺——然后要求模型在图上做真正的算法操作:从某个节点出发做广度优先遍历(BFS),或反查某节点的所有父节点(Parents)。答对需要在几十万 token 的边列表里反复跳转、维护遍历状态,考的是长上下文里的主动推理而非被动检索。数据集共 1150 个实例,按上下文长度分桶。
怎么测
每条 prompt 含 3 个演示样例、一张目标图(边列表)和一个查询,模型要输出节点 ID 列表。判分用官方配套的答案抽取和 F1 评分脚本(输出集合与标准答案算 F1,允许部分对)。常报 BFS 和 Parents 两个变体,各自按 128k/256k/1M 长度分桶。Anthropic 在自家评测中发现标准答案常为空集而官方脚本会给 0 分,对评分逻辑做过修正——这说明各家跑出来的分数可能因判分细节有差。
典型任务
一个具体任务长这样:prompt 里是几百上千行形如「3fa9c1 → 77b2e0」的边,然后问「从节点 3fa9c1 出发做 BFS,按访问顺序列出所有可达节点」。模型得在脑内(或草稿里)维护队列和已访问集合,逐层扩展——漏看一条边、记错一个已访问节点,整趟遍历就错了。Parents 变体则是反向操作:给出某个节点,列出所有指向它的父节点,需要对整个边列表做反向扫描。
分数怎么看
按 F1 计分、越高越好,且必须带长度档看:128k 上接近满分不代表 1M 上行得通。第三方收录显示 GPT-5.2 High 在 BFS 128k 档约 99.7%,而 1M 档头部模型分数明显回落(如 GPT-5.5 的 BFS 1M F1 约 57%),长桶依然是分水岭。
含金量与局限
图是程序生成的合成数据,污染风险低,但「读哈希串走图」和现实长文本应用有距离,分数高不等于长文档理解好。各厂商上报时的判分细节(如空答案集的处理)未必一致,跨模型对比要留意口径;站内「GraphWalks BFS」标签即本条的 BFS 变体。
冷知识
Anthropic 跑榜时抓到一个判分 bug:很多题的标准答案其实是空集(该节点没有父节点),而官方脚本在标准答案为空时直接记 0 分——模型「正确地说出没有」反而不得分,Anthropic 只能在系统卡里注明自己改了评分逻辑。
数据来源
本页由仓库 content/benchmarks/graphwalks.md 初始化。后续修订通过公开审核队列发布。