测试集:WebDev Arena
| 名称 | WebDev Arena |
|---|---|
| 类别 | arena |
| 主办方 | LMArena,2024-12 上线(web.lmarena.ai),与 E2B 合作提供运行沙箱 |
| 开源状态 | partial |
| 网址 | 官方页面 |
webdev-arena一句话需求生成完整可交互网页应用、E2B 沙箱实际运行,用户上手体验后盲投、统一 React + TypeScript + Tailwind 技术栈、Bradley-Terry 拟合 Elo(同母站方法论)、只测一发入魂的前端小应用,不测大型工程输入值为“一句话需求生成完整可交互网页应用、E2B 沙箱实际运行,用户上手体验后盲投、统一 React + TypeScript + Tailwind 技术栈、Bradley-Terry 拟合 Elo(同母站方法论)、只测一发入魂的前端小应用,不测大型工程”的属性“特征”(作为页面类型)含有无效字符或不完整,因此会在查询或注解过程中导致预期外结果。
测试集content/benchmarks/webdev-arena.md
一句话
同一句话,两模型各做一个网页应用,你投好用的那个
测什么
LMArena 旗下专攻网页开发的编程子榜:测的不是算法题,而是「一句话需求做出一个能跑的完整网页应用」。官方认为 HumanEval 这类传统编程榜只测孤立函数,而真实开发还包括 UI 生成、依赖处理和完整应用结构。参赛模型被统一设定为「资深前端 React 工程师 + 优秀 UI/UX 设计师」,用 React + TypeScript + Tailwind 出活。本站把它单列成条目,但口径上它是 LMArena 的子榜。
怎么测
用户提交需求,两个匿名模型各自现场生成完整网页应用并在沙箱中实际运行,用户可以与两个成品真实交互——点开页面、按按钮、玩一玩——然后盲投更好的一方(可投平局)。投票按 Bradley-Terry 模型拟合成 Elo 排名。上线初期统计约 6.1 万票、平局率 26%;官方博客 2025-03 更新时称已收集超 8 万票。
典型任务
官方博客给的典型任务:「做一个 Hacker News 克隆」「搭一个能玩的国际象棋游戏」,社区里流行的还有「克隆 Notion 主页」「做个计算器」「设计一个简洁的电商首页」「生成 Twitter 个人主页布局」。模型交的不是代码片段而是能交互的成品:象棋要能真的走子吃子,计算器按了要真出数——用户上手玩两把,谁做得扎实立刻见分晓。
分数怎么看
读法和主榜一样是 Elo 相对分,但样本量小得多,分差更难拉开——早期平局率约 26% 就说明多数任务里头部模型旗鼓相当。官方博客 2025 年初的快照里 Claude 3.7 Sonnet 以约 76% 平均胜率居首,此后排名随新模型发布持续洗牌。它与文本总榜排名并不完全同步,写代码好看的模型未必聊天讨喜。
含金量与局限
只测「一发入魂的前端小应用」,不测大型工程、后端逻辑、调试协作这些真实开发的大头;投票者以开发者玩家为主,不等于生产环境验收标准。交互成品比纯代码更难糊弄(样式再好看,按钮点不动立刻露馅),这是它相对普通编程榜的独特价值,但别把它的排名当成「编程能力总排名」。
冷知识
早期约每四票就有一票是「平局」——做个计算器、克隆个知名网站主页这类题,头部模型都能做到八九不离十,用户上手玩一圈也常分不出高下。26% 的平局率本身就是「前端小应用正在同质化」的注脚。
数据来源
本页由仓库 content/benchmarks/webdev-arena.md 初始化。后续修订通过公开审核队列发布。