WebDev Arena 测试集档案
WebDev Arena 测试集中文档案:同一句话,两模型各做一个网页应用,你投好用的那个 由 LMArena,2024-12 上线(web.lmarena.ai),与 E2B 合作提供运行沙箱 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- WebDev Arena
- LMArena WebDev 榜
- WebDev Arena(0528)
- Website Arena
- Code Arena(各变体)
- Frontend Code Arena
- Chatbot Arena WebDev
- WebDev 榜/子榜
- WebDev/前端榜
- WebDev/编程子榜
- Code(WebDev)子榜
- 编程子榜(Arena)
已发布事实
- 上线
- 2024-12,LMArena 旗下(web.lmarena.ai)
- 任务形态
- 一句话需求 → 完整可交互网页应用
- 技术栈
- 统一 React + TypeScript + Tailwind,E2B 沙箱实际运行
- 角色设定
- 系统提示为「资深前端 React 工程师 + 优秀 UI/UX 设计师」
- 数据规模
- 2025-03 官方称超 8 万票;早期统计平局率约 26%
- 算法
- Bradley-Terry 拟合 Elo,与母榜同方法论
它测什么
LMArena 旗下专攻网页开发的编程子榜:测的不是算法题,而是「一句话需求做出一个能跑的完整网页应用」。官方认为 HumanEval 这类传统编程榜只测孤立函数,而真实开发还包括 UI 生成、依赖处理和完整应用结构。参赛模型被统一设定为「资深前端 React 工程师 + 优秀 UI/UX 设计师」,用 React + TypeScript + Tailwind 出活。本站把它单列成条目,但口径上它是 LMArena 的子榜。
怎么测
用户提交需求,两个匿名模型各自现场生成完整网页应用并在沙箱中实际运行,用户可以与两个成品真实交互——点开页面、按按钮、玩一玩——然后盲投更好的一方(可投平局)。投票按 Bradley-Terry 模型拟合成 Elo 排名。上线初期统计约 6.1 万票、平局率 26%;官方博客 2025-03 更新时称已收集超 8 万票。
分数怎么看
读法和主榜一样是 Elo 相对分,但样本量小得多,分差更难拉开——早期平局率约 26% 就说明多数任务里头部模型旗鼓相当。官方博客 2025 年初的快照里 Claude 3.7 Sonnet 以约 76% 平均胜率居首,此后排名随新模型发布持续洗牌。它与文本总榜排名并不完全同步,写代码好看的模型未必聊天讨喜。
局限
只测「一发入魂的前端小应用」,不测大型工程、后端逻辑、调试协作这些真实开发的大头;投票者以开发者玩家为主,不等于生产环境验收标准。交互成品比纯代码更难糊弄(样式再好看,按钮点不动立刻露馅),这是它相对普通编程榜的独特价值,但别把它的排名当成「编程能力总排名」。
典型任务
官方博客给的典型任务:「做一个 Hacker News 克隆」「搭一个能玩的国际象棋游戏」,社区里流行的还有「克隆 Notion 主页」「做个计算器」「设计一个简洁的电商首页」「生成 Twitter 个人主页布局」。模型交的不是代码片段而是能交互的成品:象棋要能真的走子吃子,计算器按了要真出数——用户上手玩两把,谁做得扎实立刻见分晓。
沿革
- 2024-12-16:正式上线,Simon Willison 当日撰文介绍引发开发者圈关注
- 2025-03-10:官方博客复盘:已收超 8 万票,Claude 3.7 Sonnet 居首
- 2026-01:随母站更名归入 Arena 体系,web.lmarena.ai 域名沿用