测试集:Toolathlon
| 名称 | Toolathlon |
|---|---|
| 类别 | coding |
| 主办方 | HKU/CMU 等(Junlong Li 等,ICLR 2026),arXiv:2510.25726 |
| 开源状态 | open |
| 网址 | 官方页面 |
toolathlon59.932 个真实软件、604 个 MCP 工具、长程多轮操作、执行式脚本判分、无 LLM 裁判
测试集content/benchmarks/toolathlon.md
一句话
让 AI 同时操作 32 个真实软件,完成十项全能式杂务
测什么
全称 The Tool Decathlon(工具十项全能),测的是 agent 在一堆真实软件之间穿梭完成长程杂事的能力。它接入 32 个真实应用——从 Google Calendar、Notion 这类日常工具,到 WooCommerce、Kubernetes、BigQuery 这类专业平台——共暴露 604 个工具(大多基于 MCP 服务器)。任务故意写得像真人随口提的需求,考察模型能否自己选对工具、排对顺序、连续操作几十步不出错。
怎么测
共 108 个人工编写的任务,横跨研究、校园、金融、技术、商业、日常事务、电商七个领域,平均每个任务要约 20 轮工具调用。每个任务都先用真实软件状态初始化环境(比如日历里已有会议、数据库里已有数据),agent 操作完后由人工编写的执行式脚本直接检查环境的最终状态和产物,达到约 90% 的检查点才算成功,报任务成功率——不用 LLM 当裁判,没有模糊空间。
典型任务
论文摘要里给的典型场景:agent 需要「监控一个生产数据库,发现异常,然后按照操作手册生成报告」——这要求它连数据库、跑查询、读手册文档、再生成报告文件,跨多个应用连续操作。另一类任务是「协调日历和文件系统来管理邮件」:先查日历确认日程,再从文件系统找附件,最后处理邮件。每个任务开始前环境都被布置成真实状态,agent 面对的不是空白沙盒。
分数怎么看
论文发布时(2025-10)最强模型 Claude-4.5-Sonnet 只有 38.6% 成功率,连及格线都不到。此后分数上涨很快:Anthropic 系统卡披露 Claude Opus 4.8 在内部 harness 上达 59.9%(Pass@1、3 次取平均),官方榜单上游最强约 56.5%。不同 harness 下分数差异明显,比较时要对齐评测配置。
含金量与局限
任务数只有 108 个,统计噪声天然偏大;真实 MCP 环境和应用版本会随时间漂移,复现性不如纯静态基准。Anthropic 等厂商报的是自己内部 harness 的成绩,与上游官方 harness 不完全可比。作为 2025 年底才出现的新榜,头部分数一年内已上涨约 20 个百分点,需留意饱和速度。
冷知识
「十项全能」名副其实:同一套题里,agent 前一刻还在 Google Calendar 里排会、在 Notion 里整理笔记,下一刻就得去 Kubernetes 查集群、去 BigQuery 跑 SQL、去 WooCommerce 处理订单。论文发布时全场最高分 38.6%,「连最强模型也不及格」成了它最好的广告。
数据来源
本页由仓库 content/benchmarks/toolathlon.md 初始化。后续修订通过公开审核队列发布。