测试集:Claw-Eval
| 名称 | Claw-Eval |
|---|---|
| 类别 | agent |
| 主办方 | 北京大学 × 香港大学(Ye et al.,arXiv:2604.06132,2026-04) |
| 开源状态 | open |
| 网址 | 官方页面 |
claw-eval70.4轨迹三通道审计、安全分乘法门控、可控故障注入、多轮藏意图对话、300 题人工核验
测试集content/benchmarks/claw-eval.md
一句话
不只看 AI 办没办成,还全程审计它怎么办的
测什么
测自主 agent 的端到端可信度:300 个人工核验任务、9 大类分三组——General 服务编排(161 题,易/中/难三档)、多模态感知与生成(101 题:视频、文档图片、代码生成视觉产物)、多轮专业对话(38 题:STEM、社科、商业咨询)。核心理念是「轨迹可审计」:不只检查最终产物,还全程记录 agent 实际做了什么;同时把安全约束嵌进普通任务里,并用可控故障注入测鲁棒性。
怎么测
每次评测分 Setup/Execution/Judge 三个阶段严格隔离,通过三条独立证据通道取证:执行轨迹、服务端审计日志、环境快照。300 题拆解出 2,159 条细粒度 rubric(平均每题 7.2 条),客观条件用确定性规则查、开放标准用 LLM judge。总分 = 安全分(乘法门控,违规一票否决)×(完成度与鲁棒性加权)。每题跑 3 次,报 Average Score、Pass@3(至少过一次,能力上限)和 Pass^3(三次全过,可靠性下限)。
典型任务
General 难档是跨系统编排、财务合规、运维工单这类多服务协作;多模态组有视频内容定位、跨页图表推理、网页生成、SVG 动画、视频剪辑。最有特色的是多轮对话:模拟用户扮演「藏着意图」的咨询者(如法律、投资咨询),关键信息分最多 8 轮逐步透露,agent 必须主动追问才能答对——论文分析显示提问质量解释了 76% 的成绩差异,而对话轮数几乎无关(r=0.07),「会问问题」比「聊得久」重要得多。
分数怎么看
论文实测 14 个前沿模型:Claude Opus 4.6 以总分 80.4、Pass^3 70.4% 居首,Sonnet 4.6 平均分最高(81.4)。多模态明显最难,Pass^3 最高的 GPT-5.4 也只有 25.7%。故障注入实验很有说服力:把工具失败率加到 0.6,各模型 Pass@3 几乎不降、Pass^3 最多跌 24 个百分点——「偶尔办成一次」和「稳定办成」是两回事,单看前者会高估 agent。
含金量与局限
开放标准的 rubric 依赖 LLM judge(论文报告与人工评分 95% 一致);外部服务多为 mock,鲁棒性只覆盖基础设施层故障(HTTP 429/500、延迟尖峰),不含语义级对抗。名字容易撞车:勿与 ClawsBench、CLAWMARK、ClawArena 等相近名称混淆;另有动态更新的续作 Claw-Eval-Live,引用时注意是哪一版。
冷知识
论文做了个「打脸」实验:把完整对话记录和判分源码都给一个普通 LLM 裁判,它仍漏掉 44% 的安全违规和 13% 的鲁棒性问题——因为违规藏在服务端审计日志里,只看对话根本发现不了。
数据来源
本页由仓库 content/benchmarks/claw-eval.md 初始化。后续修订通过公开审核队列发布。