跳转到内容

测试集:QwenWebDev

来自封神榜 Wiki
名称 QwenWebDev
类别 coding
主办方 阿里 Qwen 团队(内部基准,随 Qwen3.7-Plus 于 2026 年中披露)
开源状态 closed
网址 [ 官方页面]

qwenwebdev中英双语网页生成、7 类任务、自动渲染 + 多模态裁判、Elo 等级分、厂商内部基准

测试集content/benchmarks/qwenwebdev.md

一句话

Qwen 内部的中英双语网页生成打榜,Elo 定高下

测什么

Qwen 团队自建的内部前端代码生成基准,测模型「一句话生成网页」的综合质量。覆盖中英双语任务,分 7 个类别:网页设计、Web 应用、游戏、SVG、数据可视化、动画和 3D。它不只看代码能不能跑,还看做出来的东西好不好看、像不像样,因此采用「自动渲染 + 多模态裁判」的评法——把模型生成的页面真实渲染出来,让多模态模型连代码带画面一起评判。

怎么测

评测产出类 Elo 的 BT 评分:模型两两生成的网页被渲染后由多模态 judge 对比裁决,胜负累积成 Elo 分数,分数越高代表综合前端能力越强。整套任务、裁判 prompt 和原始数据均未公开,外界只能看到 Qwen 发布新模型时顺带披露的对比数字。

典型任务

按类别可以想象典型任务:给一个中文或英文需求,比如「做一个带图表的销售数据看板」「写一个贪吃蛇小游戏」「生成一段加载动画」,模型要直接产出可运行的前端页面。裁判环节会把页面真实渲染成截图,多模态模型同时看代码和渲染效果,判断谁的页面功能更完整、视觉更精致。

分数怎么看

分数是 Elo 量级而非百分比,只能相对比较:Qwen3.7-Plus 发布时报 1617 分,第三方追踪站收录的 Qwen3.7 Max 为 1568、Qwen3.6-27B 为 1487。分差比绝对值更有意义——同一口径下高出几十上百分,说明生成质量有可感知的差距。

含金量与局限

典型的厂商内部基准:无独立页面、无公开数据、无第三方复核,裁判模型和对比阵容都由 Qwen 自己定,各代数字只在自家发布语境里可比。注意别与 Qwen Chat 产品里的「Qwen Web Dev」功能混为一谈;它还有个姐妹基准 QwenSVG(SVG 生成)。第三方站上出现的 QwenWebBench 等写法指的是同一个东西。

冷知识

它本质是「网页比美大赛」:Elo 计分意味着没有绝对对错,模型两两生成同一需求的页面,由多模态裁判看渲染效果判胜负、累积等级分。它还有张专考 SVG 生成的「姐妹卷」QwenSVG。最容易搞混的是:Qwen Chat 产品里有个面向用户的「Qwen Web Dev」功能,和这张内部考卷只是同名。

数据来源

本页由仓库 content/benchmarks/qwenwebdev.md 初始化。后续修订通过公开审核队列发布。