测试集:Τ²-Bench
| 名称 | τ²-Bench |
|---|---|
| 类别 | agent |
| 主办方 | Sierra Research,τ-bench(arXiv:2406.12045)升级版,τ² 论文 arXiv:2506.07982 |
| 开源状态 | open |
| 网址 | 官方页面 |
tau2-bench多轮客服对话、双控环境、政策文档约束、pass^k 稳定性指标、数据库状态判分
测试集content/benchmarks/tau2-bench.md
一句话
让 AI 当客服,边聊天边按规章办业务
测什么
模拟真实客服场景,测 AI agent 在多轮对话中调用 API、严格遵守业务政策完成用户请求的能力。覆盖 retail(零售退换货)、airline(机票改签)、telecom(电信故障排查)三个行业域。它最大的特色是「双控环境」:不只 agent 能调用工具改环境,用户模拟器自己也能操作系统——还原了真实客服里「客服指导用户自己动手」的场面。每个域配一份政策文档和一套工具,任务就是各种用户诉求。
怎么测
agent 拿到政策文档和工具集,与一个由 LLM 扮演的用户多轮对话,通过调用工具修改背后的数据库来办事。判分不看对话说得多漂亮,而是对比对话结束后数据库的最终状态与标准答案状态是否一致(逐条核对预期动作)。主指标是 pass^k:同一个任务连跑 k 次、每次都成功的比例,k 越大越能暴露「会做但不稳定」的问题。
典型任务
电信域的双控任务最典型:用户手机连不上网,agent 无法远程修好,必须一步步指导用户自己操作——比如开关飞行模式、重置网络设置——用户模拟器会用「用户工具」真实地改变共享环境的状态,agent 说错了步骤就失败。航空域的任务如用户要求改签航班,政策规定某些舱位不能免费改,agent 要先查订座记录、判断资格、再执行改签;零售域则是退货、换货、退款这类订单操作。
分数怎么看
这个榜的看点不在 pass^1(头部模型单次成功率已经不低),而在 pass^k 曲线:很多模型跑一次能成,连跑 8 次全对的比例明显下滑,直接量化了客服场景最忌讳的不稳定。论文还做了消融实验:同一个 agent 从「无用户」模式切到双控模式后成功率显著下降,说明「指导用户配合」本身就是难点。
含金量与局限
判分依赖数据库状态精确匹配,任务本身有过勘误:2026-07 发布 v1.0.1 修复 banking_knowledge 域任务错误,官方明确此前版本分数不可与新版本比较。另外用户由 LLM 模拟,模拟器的拟真程度会影响成绩;项目后续演进为含语音、知识检索域的 τ³-bench,注意区分版本。
冷知识
名字里的 τ 来自 Tool-Agent-User 三方交互的首字母。升到第三代后名字越来越拗口,官方 README 干脆自嘲:τ³-bench 怎么读?「我们就念 tau three,你随意」。
数据来源
本页由仓库 content/benchmarks/tau2-bench.md 初始化。后续修订通过公开审核队列发布。