测试集:Agent Arena
| 名称 | Agent Arena |
|---|---|
| 类别 | agent |
| 主办方 | UC Berkeley Gorilla 团队,2024-10 上线(agent-arena.com) |
| 开源状态 | open |
| 网址 | 官方页面 |
agent-arena用户投票式对战(Chatbot Arena 思路移植到 agent)、按「模型+框架+工具」三元组拆评并附三张子榜、Elo 评分 + Bradley-Terry 逻辑回归归因子组件、1,000+ 真实用户任务 prompt hub、2024 年后活跃度走低,榜单停留 2024-12输入值为“用户投票式对战(Chatbot Arena 思路移植到 agent)、按「模型+框架+工具」三元组拆评并附三张子榜、Elo 评分 + Bradley-Terry 逻辑回归归因子组件、1,000+ 真实用户任务 prompt hub、2024 年后活跃度走低,榜单停留 2024-12”的属性“特征”(作为页面类型)含有无效字符或不完整,因此会在查询或注解过程中导致预期外结果。
测试集content/benchmarks/agent-arena.md
一句话
让两个 AI agent 同题对战,用户投票定排名
测什么
Chatbot Arena 思路在 agent 上的移植:用户出一道题,两个 agent 各自实跑,用户投票选更好的那个。它的独特之处是把 agent 拆成「模型 + 框架 + 工具」三元组来评——比如 LangChain + Brave-Search + GPT-4o 对阵 LlamaIndex + Wikipedia + Claude-3.5-Sonnet——用扩展的 Bradley-Terry 模型把一场对局的胜负归因到每个子组件上,因此除了 agent 总榜,还能拆出模型榜、工具榜、框架榜。平台还带一个 1,000+ 任务的 prompt hub,可以看到真实用户都在让 agent 干什么。
怎么测
计分是 Elo 式对战评分:每局对战胜负更新双方评分,并用逻辑回归(L2 正则)拟合各子组件对胜负的贡献,避免常见组合搭配带来的混淆。排名实时更新,既能看整体 agent 强弱,也能回答「是不是这个搜索工具拖了后腿」这类问题。
典型任务
官方博客展示的真实对战:用户给一份去年销售数据 CSV 让 agent 分析该加大哪些产品——GPT-4o + SQL agent 把 CSV 误当 SQLite 数据库报错卡壳,GPT-4o + Pandas DataFrame 则顺利找出畅销的 Laptop、Smartphone 并建议扩产 Headphones。另一例是「规划旧金山到 Carmel-by-the-Sea 的一日游,选最省油且景点最多的路线」,crewAI 旅行规划 agent 与 LangChain 搜索 agent 同题竞技,胜负由用户看谁给的行程更靠谱。
分数怎么看
看这个榜的正确姿势是盯子组件榜而不只是总榜:总 Elo 告诉你哪个组合强,子组件分告诉你强在模型还是工具。适合给「我该选什么框架配什么模型」找参考。注意它近年活跃度一般,投票量有限时 Elo 波动较大,排名只能当方向性参考。
含金量与局限
重名重灾区:本站锚定 Berkeley Gorilla 团队这个 Agent Arena,勿与微软 Windows Agent Arena、Android Agent Arena 等同名基准混淆。机制上它是用户投票式评估,主观性强、样本量小,权威性不如执行校验型基准;平台规划中的多轮、私有数据接入等能力多年未完全落地。
冷知识
官方博客里有个名场面:同一道「分析销售 CSV 该扩产什么」的题,GPT-4o + SQL agent 把 CSV 误当 SQLite 数据库直接报错卡壳,GPT-4o + Pandas 却顺利给出答案——同一模型换个框架,胜负立判,这正是它要拆子组件评分的原因。
数据来源
本页由仓库 content/benchmarks/agent-arena.md 初始化。后续修订通过公开审核队列发布。