跳转到内容

测试集:Claw-Eval

来自封神榜 Wiki
名称 Claw-Eval
类别 agent
主办方 北京大学 × 香港大学(Ye et al.,arXiv:2604.06132,2026-04)
开源状态 open
网址 官方页面

claw-eval70.4轨迹三通道审计、安全分乘法门控、可控故障注入、多轮藏意图对话、300 题人工核验

测试集content/benchmarks/claw-eval.md

一句话

不只看 AI 办没办成,还全程审计它怎么办的

测什么

测自主 agent 的端到端可信度:300 个人工核验任务、9 大类分三组——General 服务编排(161 题,易/中/难三档)、多模态感知与生成(101 题:视频、文档图片、代码生成视觉产物)、多轮专业对话(38 题:STEM、社科、商业咨询)。核心理念是「轨迹可审计」:不只检查最终产物,还全程记录 agent 实际做了什么;同时把安全约束嵌进普通任务里,并用可控故障注入测鲁棒性。

怎么测

每次评测分 Setup/Execution/Judge 三个阶段严格隔离,通过三条独立证据通道取证:执行轨迹、服务端审计日志、环境快照。300 题拆解出 2,159 条细粒度 rubric(平均每题 7.2 条),客观条件用确定性规则查、开放标准用 LLM judge。总分 = 安全分(乘法门控,违规一票否决)×(完成度与鲁棒性加权)。每题跑 3 次,报 Average Score、Pass@3(至少过一次,能力上限)和 Pass^3(三次全过,可靠性下限)。

典型任务

General 难档是跨系统编排、财务合规、运维工单这类多服务协作;多模态组有视频内容定位、跨页图表推理、网页生成、SVG 动画、视频剪辑。最有特色的是多轮对话:模拟用户扮演「藏着意图」的咨询者(如法律、投资咨询),关键信息分最多 8 轮逐步透露,agent 必须主动追问才能答对——论文分析显示提问质量解释了 76% 的成绩差异,而对话轮数几乎无关(r=0.07),「会问问题」比「聊得久」重要得多。

分数怎么看

论文实测 14 个前沿模型:Claude Opus 4.6 以总分 80.4、Pass^3 70.4% 居首,Sonnet 4.6 平均分最高(81.4)。多模态明显最难,Pass^3 最高的 GPT-5.4 也只有 25.7%。故障注入实验很有说服力:把工具失败率加到 0.6,各模型 Pass@3 几乎不降、Pass^3 最多跌 24 个百分点——「偶尔办成一次」和「稳定办成」是两回事,单看前者会高估 agent。

含金量与局限

开放标准的 rubric 依赖 LLM judge(论文报告与人工评分 95% 一致);外部服务多为 mock,鲁棒性只覆盖基础设施层故障(HTTP 429/500、延迟尖峰),不含语义级对抗。名字容易撞车:勿与 ClawsBench、CLAWMARK、ClawArena 等相近名称混淆;另有动态更新的续作 Claw-Eval-Live,引用时注意是哪一版。

冷知识

论文做了个「打脸」实验:把完整对话记录和判分源码都给一个普通 LLM 裁判,它仍漏掉 44% 的安全违规和 13% 的鲁棒性问题——因为违规藏在服务端审计日志里,只看对话根本发现不了。

数据来源

本页由仓库 content/benchmarks/claw-eval.md 初始化。后续修订通过公开审核队列发布。