BenchLM 测试集档案
BenchLM 测试集中文档案:自己不出题,把几百个外部基准加权揉成总分 由 benchlm.ai 独立站点(运营主体未披露),数据刷新至 2026-08 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- BenchLM
- BenchLM 综合
- BenchLM.ai 综合
- BenchLM 公共榜
- BenchLM 数学/编程/知识/Agent/Agentic
- Coding 分榜
- 4 基准几何均值(HN 顶评)
- benchlm.ai 独立站点(运营主体未披露),数据刷新至 2026-08
已发布事实
- 属性
- 聚合榜:自身无考题,索引外部基准加价格/速度数据
- 覆盖
- 2026-08 首页口径:436 个基准、391 个模型(218 个入榜)
- 计分
- 私有 BenchAlign v5.2:27 个计权基准、8 大类加权合成
- 类权重
- Agentic 22% / Coding 20% / Reasoning 17% 等
- 证据标签
- Supported(有直接第三方证据)/ Estimated(估计值,仍入榜)
- 主体
- 运营方未披露
它测什么
一个聚合型榜单:它自己没有任何一道题,而是索引约 400 个外部基准(编程、推理、数学、知识、Agent 等各类)外加价格、速度数据,用私有方法把别人的分数揉成综合排名和分榜。定位类似「基准的基准」——给你一个一眼看全局的入口。按核验结论,它属二手聚合榜,权威性不及 LMArena、Artificial Analysis 这类一手数据方。
怎么测
私有方法论叫 BenchAlign,当前版本 v5.2:约 400 个被索引的基准中只有 27 个计入加权总分(其余仅作展示),先归一化再按 8 大类加权合成——Agentic 22%、Coding 20%、Reasoning 17% 等。每个模型带证据强度标签:Supported 表示有直接第三方证据,Estimated 表示证据不足时的估计值——Estimated 也保留在榜上,官方理由是免得新模型只因没被测够就被当成弱模型。
分数怎么看
官方自己强调:分数是「相对当前证据宇宙的校准分」,不是任何单一测试的原始百分数,所以 80 分不代表做对了 80% 的题。2026-08 快照里头部模型总分在 80 上下、编程分榜头部约 80 分。Estimated 行的不确定性明显更大,看榜时要区分。
局限
聚合榜的天花板是被引用的基准:源数据错了它会跟着错,且方法论私有、外部无法复算验证。适合快速扫一眼行业格局,不适合在严肃对比中当定论引用;要深究某项能力,应该回到它引用的一手基准去查原始分数。
典型任务
它不是一道题而是一摞别人的题:编程分榜里 SWE-bench Verified 一项占该类约 16% 权重,旁边拼着 LiveCodeBench 等信号;数学分榜引用 FrontierMath、AIME 之类。点开任一模型,能看到它的总分由哪些外部基准、各占多少权重拼出来,比如某模型的编程分项会标注主要差距来自哪个基准。
沿革
- 2026-04:评测博客已在稳定更新(可考的较早公开内容),开始输出基准解读长文
- 2026-07-13:发布 LMArena Elo 方法论拆解文,确立「评榜单的榜单」内容路线
- 2026-08-05:八月榜刷新:104 个 Supported + 111 个 Estimated 模型在榜(第三方转述)
- 2026-08-12:方法论页更新至 BenchAlign v5.2:27 个计权基准、8 类加权