跳转到内容

测试集:ClawBench

来自封神榜 Wiki
名称 ClawBench
类别 coding
主办方 TIGER-AI-Lab,arXiv:2604.08523(2026-04)
开源状态 open
网址 官方页面

clawbench33.3144 个真实网站、写操作任务、拦截最终提交请求、LLM judge 判分、五层轨迹记录

测试集content/benchmarks/clawbench.md

一句话

让浏览器 agent 在真实网站上订机票、点外卖、投简历

测什么

测浏览器 agent 在真实互联网上替人办日常杂事的能力。与在沙盒仿站里测试的旧榜单不同,它直接让 agent 操作 144 个真实线上网站,完成 153 个「会改变真实状态」的任务——下单、预订、投递这类写操作,正是以往基准刻意回避的。任务覆盖 15 个生活品类(出行、外卖、求职、邮件等)。V2 版本另有 130 个任务。

怎么测

关键设计是「最终请求拦截」:agent 可以在真实网站上自由浏览、填表、走到提交前的最后一步,但一个 Chrome 扩展会拦下真正产生现实后果的那个 HTTP 请求(比如真正的支付提交),从而安全地在生产网站上评测。评测全程做五层轨迹记录,再由 Agent-as-Judge 协议把 agent 的操作轨迹与人类参考轨迹对比,结合 DOM 匹配给出可追溯的二元成败判定,报任务成功率。

典型任务

典型任务就是你我每天会做的事:在航司或旅行网站上订一段指定条件的行程、在外卖平台按要求下一单、在招聘网站投递一份简历、处理邮箱里的某类邮件。这些任务对人类稀松平常,对 agent 却暗藏杀机:论文的失败分析显示,反爬虫拦截、不自然的点击行为被网站识别、安全拒答等是反复出现的翻车原因。

分数怎么看

目前的天花板很低:最强模型 Claude Sonnet 4.6 成功率仅 33.3%,而它在传统网页 agent 榜上能拿 65%–75%——论文最核心的发现就是「沙盒榜高分不代表真实网络能干活」,旧榜成绩几乎无法迁移到 ClawBench。

含金量与局限

真实网站会改版、会上新的反爬策略,任务可复现性天然随时间衰减,分数带时间戳属性。评测依赖 LLM 当裁判(与人类参考轨迹比对),裁判本身有判断误差。名字注意区分:GitHub 上另有 devswha/claw-bench 等同名项目,本条指 TIGER-AI-Lab 版。按任务属性它偏浏览器 agent 评测,并非纯编程榜。

冷知识

为了不在真实世界闯祸,评测只拦「最后一击」:agent 可以一路把外卖选到支付页、把机票订到确认页,但真正产生后果的那个提交请求会被扩展拦下评分。论文最扎心的发现之一:很多失败不是能力不够,而是操作「太不像人」——点击节奏太机械,被网站反爬系统当场识破。

数据来源

本页由仓库 content/benchmarks/clawbench.md 初始化。后续修订通过公开审核队列发布。