跳转到内容

测试集:LMArena(Arena)

来自封神榜 Wiki
名称 LMArena(Arena)
类别 arena
主办方 UC Berkeley LMSYS Org(2023-04 起源),2025-04 独立为 Arena Intelligence Inc.;论文 arXiv:2403.04132
开源状态 partial
网址 官方页面

lmarena真实用户匿名对战盲投、无固定题库,覆盖真实使用场景、Bradley-Terry 拟合 Elo + bootstrap 置信区间、偏好榜:偏「好看」而非「正确」(啰嗦偏置)、多子榜:文本/编程/视觉/WebDev/搜索等

测试集content/benchmarks/lmarena.md

一句话

两个匿名模型同题作答,真人盲投谁更好

测什么

前身是大名鼎鼎的 LMSYS Chatbot Arena,2026-01-28 正式更名「Arena」。它没有固定题库:真实用户随便出题,系统随机抽两个模型匿名并排作答,用户投出「A 更好 / B 更好 / 平局 / 都差」。测的不是客观对错,而是真实用户的主观偏好——谁的回答更有用、更顺眼、更像人话。旗下分总榜/文本、编程、视觉、WebDev、搜索、文生图等多个子榜。因为数据来自海量真实使用场景,它长期被视为「用户口碑榜」的代名词。

怎么测

Battle 模式下用户输入 prompt 后两模型同时作答,投完票才揭晓模型身份,防止品牌滤镜。平台把海量成对投票用 Bradley-Terry 模型(和体育排名同族)拟合成 Elo 分数,并用 bootstrap 重采样给出置信区间。官方论文统计 2025 年初已积累超过 300 万票。Elo 是相对分:差 100 分约对应 64% 的预期胜率,差 20 分只有约 53%。

典型任务

题目就是用户当场想问的任何东西:写一封请假邮件、解释量子纠缠、起一个品牌名。比如用户贴一段崩溃的 C 代码问「为什么 segfault」,两个匿名模型各自诊断,用户把票投给真正帮自己定位到问题、讲得清楚的那个;又比如让两边各写一首关于失业的诗,用户纯粹凭「哪首更打动我」投票——这里没有标准答案,投票者的喜好就是答案。

分数怎么看

头部模型之间经常只差十几到几十分,而 Elo 差 100 分才对应约 64% 胜率,所以小差距基本是噪声,要看置信区间是否重叠。2026 年中其编程子榜头部模型 Elo 在 1550 上下,前几名咬合极紧。读这个榜的正确姿势是先看自己关心的子榜,再看分差是否拉得开。

含金量与局限

偏好榜天然偏爱「好看」而非「正确」:学界明确记录了啰嗦偏置(更长的回答更容易赢票)。论文《The Leaderboard Illusion》(arXiv:2504.20879)还指出大厂可私下测试多个变体只公开最高分、并获得更多对战数据倾斜等问题。它回答的是「用户喜欢谁」,不等于「谁更正确」;站内曾出现的「Arena.ai 综合榜」「编程盲测挑战赛」都是它或它的子榜。

冷知识

2025 年论文《The Leaderboard Illusion》(arXiv:2504.20879)披露:Meta 在 Llama 4 发布前私下测试了 27 个变体,只把得分最高的那个放上公开榜——「定向刷榜」争议由此出圈,平台随后收紧了私测变体的上榜政策。

数据来源

本页由仓库 content/benchmarks/lmarena.md 初始化。后续修订通过公开审核队列发布。