跳转到内容

测试集:Toolathlon

来自封神榜 Wiki
名称 Toolathlon
类别 coding
主办方 HKU/CMU 等(Junlong Li 等,ICLR 2026),arXiv:2510.25726
开源状态 open
网址 官方页面

toolathlon59.932 个真实软件、604 个 MCP 工具、长程多轮操作、执行式脚本判分、无 LLM 裁判

测试集content/benchmarks/toolathlon.md

一句话

让 AI 同时操作 32 个真实软件,完成十项全能式杂务

测什么

全称 The Tool Decathlon(工具十项全能),测的是 agent 在一堆真实软件之间穿梭完成长程杂事的能力。它接入 32 个真实应用——从 Google Calendar、Notion 这类日常工具,到 WooCommerce、Kubernetes、BigQuery 这类专业平台——共暴露 604 个工具(大多基于 MCP 服务器)。任务故意写得像真人随口提的需求,考察模型能否自己选对工具、排对顺序、连续操作几十步不出错。

怎么测

共 108 个人工编写的任务,横跨研究、校园、金融、技术、商业、日常事务、电商七个领域,平均每个任务要约 20 轮工具调用。每个任务都先用真实软件状态初始化环境(比如日历里已有会议、数据库里已有数据),agent 操作完后由人工编写的执行式脚本直接检查环境的最终状态和产物,达到约 90% 的检查点才算成功,报任务成功率——不用 LLM 当裁判,没有模糊空间。

典型任务

论文摘要里给的典型场景:agent 需要「监控一个生产数据库,发现异常,然后按照操作手册生成报告」——这要求它连数据库、跑查询、读手册文档、再生成报告文件,跨多个应用连续操作。另一类任务是「协调日历和文件系统来管理邮件」:先查日历确认日程,再从文件系统找附件,最后处理邮件。每个任务开始前环境都被布置成真实状态,agent 面对的不是空白沙盒。

分数怎么看

论文发布时(2025-10)最强模型 Claude-4.5-Sonnet 只有 38.6% 成功率,连及格线都不到。此后分数上涨很快:Anthropic 系统卡披露 Claude Opus 4.8 在内部 harness 上达 59.9%(Pass@1、3 次取平均),官方榜单上游最强约 56.5%。不同 harness 下分数差异明显,比较时要对齐评测配置。

含金量与局限

任务数只有 108 个,统计噪声天然偏大;真实 MCP 环境和应用版本会随时间漂移,复现性不如纯静态基准。Anthropic 等厂商报的是自己内部 harness 的成绩,与上游官方 harness 不完全可比。作为 2025 年底才出现的新榜,头部分数一年内已上涨约 20 个百分点,需留意饱和速度。

冷知识

「十项全能」名副其实:同一套题里,agent 前一刻还在 Google Calendar 里排会、在 Notion 里整理笔记,下一刻就得去 Kubernetes 查集群、去 BigQuery 跑 SQL、去 WooCommerce 处理订单。论文发布时全场最高分 38.6%,「连最强模型也不及格」成了它最好的广告。

数据来源

本页由仓库 content/benchmarks/toolathlon.md 初始化。后续修订通过公开审核队列发布。