LMArena(Arena) 测试集档案
LMArena(Arena) 测试集中文档案:两个匿名模型同题作答,真人盲投谁更好 由 UC Berkeley LMSYS Org(2023-04 起源),2025-04 独立为 Arena Intelligence Inc.;论文 arXiv:2403.04132 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- LMArena(Arena)
- LMSYS Chatbot Arena
- Chatbot Arena(各变体)
- LMArena 各变体(总榜/文本榜/综合/Elo/视觉/编程子榜/开源榜等)
- Arena.ai 综合榜
- Text Arena
- Vision Arena
- Vision 榜
- Hard Prompts
- Style Control(de-biased)
- V4-Flash 文本榜/Text Arena
- HF / LMArena 开源榜
已发布事实
- 上线
- 2023-04,UC Berkeley LMSYS Org 推出 Chatbot Arena
- 机制
- 匿名双模型同题对战,真实用户盲投(A 好/B 好/平局/都差)
- 算法
- Bradley-Terry 模型拟合 Elo,bootstrap 置信区间
- 数据规模
- 2025 年初官方论文统计已超 300 万票
- 子榜
- 总榜/文本、编程、视觉、WebDev、搜索、文生图等
- 现状
- 2026-01 更名 Arena,A 轮后估值 $1.7B
它测什么
前身是大名鼎鼎的 LMSYS Chatbot Arena,2026-01-28 正式更名「Arena」。它没有固定题库:真实用户随便出题,系统随机抽两个模型匿名并排作答,用户投出「A 更好 / B 更好 / 平局 / 都差」。测的不是客观对错,而是真实用户的主观偏好——谁的回答更有用、更顺眼、更像人话。旗下分总榜/文本、编程、视觉、WebDev、搜索、文生图等多个子榜。因为数据来自海量真实使用场景,它长期被视为「用户口碑榜」的代名词。
怎么测
Battle 模式下用户输入 prompt 后两模型同时作答,投完票才揭晓模型身份,防止品牌滤镜。平台把海量成对投票用 Bradley-Terry 模型(和体育排名同族)拟合成 Elo 分数,并用 bootstrap 重采样给出置信区间。官方论文统计 2025 年初已积累超过 300 万票。Elo 是相对分:差 100 分约对应 64% 的预期胜率,差 20 分只有约 53%。
分数怎么看
头部模型之间经常只差十几到几十分,而 Elo 差 100 分才对应约 64% 胜率,所以小差距基本是噪声,要看置信区间是否重叠。2026 年中其编程子榜头部模型 Elo 在 1550 上下,前几名咬合极紧。读这个榜的正确姿势是先看自己关心的子榜,再看分差是否拉得开。
局限
偏好榜天然偏爱「好看」而非「正确」:学界明确记录了啰嗦偏置(更长的回答更容易赢票)。论文《The Leaderboard Illusion》(arXiv:2504.20879)还指出大厂可私下测试多个变体只公开最高分、并获得更多对战数据倾斜等问题。它回答的是「用户喜欢谁」,不等于「谁更正确」;站内曾出现的「Arena.ai 综合榜」「编程盲测挑战赛」都是它或它的子榜。
典型任务
题目就是用户当场想问的任何东西:写一封请假邮件、解释量子纠缠、起一个品牌名。比如用户贴一段崩溃的 C 代码问「为什么 segfault」,两个匿名模型各自诊断,用户把票投给真正帮自己定位到问题、讲得清楚的那个;又比如让两边各写一首关于失业的诗,用户纯粹凭「哪首更打动我」投票——这里没有标准答案,投票者的喜好就是答案。
沿革
- 2023-04:UC Berkeley LMSYS Org 上线 Chatbot Arena,首创大规模匿名对战盲投
- 2024-03:论文 arXiv:2403.04132 发表,确立 Bradley-Terry + 置信区间方法论
- 2024-09:独立站点 lmarena.ai 上线,脱离 LMSYS 博客形态
- 2025-04:分拆为公司 Arena Intelligence Inc.
- 2025-05:获 $100M 种子轮融资
- 2026-01:获 $150M A 轮(估值 $1.7B),01-28 正式更名「Arena」(arena.ai)