测试集:MCP Atlas
| 名称 | MCP Atlas |
|---|---|
| 类别 | agent |
| 主办方 | Scale AI(Bandi 等,arXiv:2602.00933,2026),同时为 Scale SEAL 旗下榜单 |
| 开源状态 | partial |
| 网址 | 官方页面 |
mcp-atlas82.236 个生产级真实 MCP server、220 个真实工具、干扰项混入逼工具发现、98.6% 任务跨 server 编排、500 公开 + 500 私有防污染
测试集content/benchmarks/mcp-atlas.md
一句话
给 AI 一屋子真工具,看它会不会自己挑着用
测什么
测 agent 通过 MCP(Model Context Protocol)调用真实工具干活的能力。36 个生产级 MCP server、220 个真工具、1,000 道人工撰写并校验的任务,跨搜索、分析、办公、金融、编程五类环境。两个关键设计:prompt 全用自然语言、绝不点名该用哪个工具;每题候选工具里混着大量「看起来相关其实没用」的干扰项,逼 agent 自己发现工具链。98.6% 的任务需要跨两个以上 server 编排,后面工具调用的参数往往依赖前面的返回结果。
怎么测
每题给 agent 6–37 个候选工具(平均 15 个,真正需要的只有 2–8 个),单轮拿到需求后自主调用,调用上限 100 次。判分走「claim 制」:每题配一组原子事实 claim(平均 4.7 条),只要最终答案覆盖了这些事实就算对,不管你走哪条工具路径——这避免了对「路线不同但结果正确」的误判。judge 逐条打 0/0.5/1 分,覆盖率 ≥0.75 算通过;三个独立 LLM judge 交叉评分,1,000 题分 500 公开 + 500 私有以防过拟合榜单。
典型任务
典型任务是跨 server 的多跳请求,比如「查某公司最近的财务数据、和竞品对比、整理成表格存档」这类需要搜索 + 数据接口 + 文件/表格工具串联的活儿。论文附录完整解剖了一道公开题:给出原始 prompt、启用的工具清单(含干扰项)、必须命中的 claim 列表和一份满分回答,可以看到 agent 要先调搜索拿线索、再把结果当参数喂给下一个工具。失败案例也具体:有的模型工具全调对了,却「提前收工」漏掉一条 claim。
分数怎么看
论文实测 20 个前沿模型呈三层分布:头部三家 78.2%–82.2%(最高 82.2%),开源最强的 GLM-5.1 达 75.6% 挤进第一梯队,榜尾到 40.2%。最有意思的发现是失败归因:63.3% 的失败是「认知问题」(理解错需求、提前停止、综合出错)而非工具调用失败;推理强者 o3 Pro 只得 44.5%,因为它 40% 的失败轨迹里压根没调工具。
含金量与局限
绝对分数有两个天然误差带:judge 之间差 2–5 个百分点,0.75 的通过阈值是人为设定。真实 server 会漂移(限流、接口改版),官方坦言榜单只是 2026-05 的快照,复现以容器版本钉住为准。它与 Scale SEAL 有从属关系(SEAL 旗下子榜),引用时留意语境;数据集 500 题公开、500 题私有,外部复现只能跑公开一半。
冷知识
推理榜常客 o3 Pro 在这里只拿 44.5%——它 40% 的失败轨迹里压根没调用任何工具,全程「空想」。论文结论很扎心:强模型的主要死因不是不会调工具,而是证据没收齐就提前收工。
数据来源
本页由仓库 content/benchmarks/mcp-atlas.md 初始化。后续修订通过公开审核队列发布。