测试集:QwenWebDev
| 名称 | QwenWebDev |
|---|---|
| 类别 | coding |
| 主办方 | 阿里 Qwen 团队(内部基准,随 Qwen3.7-Plus 于 2026 年中披露) |
| 开源状态 | closed |
| 网址 | [ 官方页面] |
qwenwebdev中英双语网页生成、7 类任务、自动渲染 + 多模态裁判、Elo 等级分、厂商内部基准
测试集content/benchmarks/qwenwebdev.md
一句话
Qwen 内部的中英双语网页生成打榜,Elo 定高下
测什么
Qwen 团队自建的内部前端代码生成基准,测模型「一句话生成网页」的综合质量。覆盖中英双语任务,分 7 个类别:网页设计、Web 应用、游戏、SVG、数据可视化、动画和 3D。它不只看代码能不能跑,还看做出来的东西好不好看、像不像样,因此采用「自动渲染 + 多模态裁判」的评法——把模型生成的页面真实渲染出来,让多模态模型连代码带画面一起评判。
怎么测
评测产出类 Elo 的 BT 评分:模型两两生成的网页被渲染后由多模态 judge 对比裁决,胜负累积成 Elo 分数,分数越高代表综合前端能力越强。整套任务、裁判 prompt 和原始数据均未公开,外界只能看到 Qwen 发布新模型时顺带披露的对比数字。
典型任务
按类别可以想象典型任务:给一个中文或英文需求,比如「做一个带图表的销售数据看板」「写一个贪吃蛇小游戏」「生成一段加载动画」,模型要直接产出可运行的前端页面。裁判环节会把页面真实渲染成截图,多模态模型同时看代码和渲染效果,判断谁的页面功能更完整、视觉更精致。
分数怎么看
分数是 Elo 量级而非百分比,只能相对比较:Qwen3.7-Plus 发布时报 1617 分,第三方追踪站收录的 Qwen3.7 Max 为 1568、Qwen3.6-27B 为 1487。分差比绝对值更有意义——同一口径下高出几十上百分,说明生成质量有可感知的差距。
含金量与局限
典型的厂商内部基准:无独立页面、无公开数据、无第三方复核,裁判模型和对比阵容都由 Qwen 自己定,各代数字只在自家发布语境里可比。注意别与 Qwen Chat 产品里的「Qwen Web Dev」功能混为一谈;它还有个姐妹基准 QwenSVG(SVG 生成)。第三方站上出现的 QwenWebBench 等写法指的是同一个东西。
冷知识
它本质是「网页比美大赛」:Elo 计分意味着没有绝对对错,模型两两生成同一需求的页面,由多模态裁判看渲染效果判胜负、累积等级分。它还有张专考 SVG 生成的「姐妹卷」QwenSVG。最容易搞混的是:Qwen Chat 产品里有个面向用户的「Qwen Web Dev」功能,和这张内部考卷只是同名。
数据来源
本页由仓库 content/benchmarks/qwenwebdev.md 初始化。后续修订通过公开审核队列发布。