QwenWebDev 测试集档案
QwenWebDev 测试集中文档案:Qwen 内部的中英双语网页生成打榜,Elo 定高下 由 阿里 Qwen 团队(内部基准,随 Qwen3.7-Plus 于 2026 年中披露) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- QwenWebDev
- 阿里 Qwen 团队(内部基准,随 Qwen3.7-Plus 于 2026 年中披露)
已发布事实
- 发布方
- 阿里 Qwen 团队(内部基准)
- 披露时间
- 2026 年中,随 Qwen3.7-Plus 发布
- 任务语言
- 中英双语
- 任务类别
- 网页设计、Web 应用、游戏、SVG、数据可视化、动画、3D 共 7 类
- 评测方式
- 生成页面自动渲染,多模态 judge 连代码带画面评判
- 计分
- BT/Elo 等级分(非百分比)
它测什么
Qwen 团队自建的内部前端代码生成基准,测模型「一句话生成网页」的综合质量。覆盖中英双语任务,分 7 个类别:网页设计、Web 应用、游戏、SVG、数据可视化、动画和 3D。它不只看代码能不能跑,还看做出来的东西好不好看、像不像样,因此采用「自动渲染 + 多模态裁判」的评法——把模型生成的页面真实渲染出来,让多模态模型连代码带画面一起评判。
怎么测
评测产出类 Elo 的 BT 评分:模型两两生成的网页被渲染后由多模态 judge 对比裁决,胜负累积成 Elo 分数,分数越高代表综合前端能力越强。整套任务、裁判 prompt 和原始数据均未公开,外界只能看到 Qwen 发布新模型时顺带披露的对比数字。
分数怎么看
分数是 Elo 量级而非百分比,只能相对比较:Qwen3.7-Plus 发布时报 1617 分,第三方追踪站收录的 Qwen3.7 Max 为 1568、Qwen3.6-27B 为 1487。分差比绝对值更有意义——同一口径下高出几十上百分,说明生成质量有可感知的差距。
局限
典型的厂商内部基准:无独立页面、无公开数据、无第三方复核,裁判模型和对比阵容都由 Qwen 自己定,各代数字只在自家发布语境里可比。注意别与 Qwen Chat 产品里的「Qwen Web Dev」功能混为一谈;它还有个姐妹基准 QwenSVG(SVG 生成)。第三方站上出现的 QwenWebBench 等写法指的是同一个东西。
典型任务
按类别可以想象典型任务:给一个中文或英文需求,比如「做一个带图表的销售数据看板」「写一个贪吃蛇小游戏」「生成一段加载动画」,模型要直接产出可运行的前端页面。裁判环节会把页面真实渲染成截图,多模态模型同时看代码和渲染效果,判断谁的页面功能更完整、视觉更精致。
沿革
- 2026-05/06:随 Qwen3.7-Plus 发布首次披露,自报 Elo 1617
- 2026-06:benchmarklist 等第三方站开始收录各家自报数字(Qwen3.6 Plus 1500 等)
- 2026-08:llm-stats 以「QwenWebBench」名目收录榜单,收录 2 个自报成绩,Qwen3.7 Max 1568 居首