KingBench 测试集档案
KingBench 测试集中文档案:UP 主自办实跑评测:让模型真做完整项目再打分 由 YouTube 创作者「AICodeKing」个人基准(2.0/3 版本 + Agent Leaderboard) 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- KingBench
- KingBench Agent 榜
- KingBench 编程榜
- YouTube 创作者「AICodeKing」个人基准(2.0/3 版本 + Agent Leaderboard)
已发布事实
- 性质
- 个人创作者基准(YouTube UP 主 AICodeKing),无官网、无论文
- 任务量
- 约 8 个实跑任务
- 题型
- 完整项目构建、长程 agentic 任务、3D 建模/网页类任务
- 计分
- 逐题人工打分汇总,早期 80 分制,KingBench 3 为百分制量级
- 发布渠道
- 创作者的视频与帖子,成绩依赖二手转述
它测什么
一个由个人创作者运营的小型实跑评测,约 8 个任务,主打真实编码与 agentic 场景:从零构建完整项目、长程连续任务、3D 建模/网页类任务等,评分时强调「代码品味」——不只看能不能跑,还看 UX、逻辑结构和工程完成度。另有针对长程自主任务的 Agent Leaderboard,观察模型搭配 Claude Code 等 agent 工具连续干活的表现。已迭代到 2.0/3 版本。
怎么测
没有公开数据集和自动化评分管线:创作者在自己的流程里让各模型完成同一批任务,逐题打分后汇总(早期为 80 分制,KingBench 3 为百分制量级),排成榜单,通过视频和帖子发布。成绩本质上是「同一人、同一流程下的实跑横评」。
分数怎么看
在社区(尤其模型发布讨论)里颇有存在感,GLM-5/5.2、DeepSeek V4 Flash 等模型的第三方实测成绩常出自它。适合当作「真实项目手感」的旁证:一个模型在学术榜上平平但在这里分高,往往说明实跑体验不错。分数绝对值无横向意义,只看同一期榜单内的相对排名。
局限
个人基准,本站明确标注:无公开数据集、无论文、无可复现流程,评分含主观成分,任务只有约 8 个,统计意义有限;成绩只能通过创作者的视频/帖子获取,二手转述可能走样。作为参考信号可以,作为选型依据不够。
典型任务
从创作者发布内容看,任务形态是让模型一次性交付完整作品:比如从零搭一个可运行的完整应用、做 3D 建模类任务、或连续运行数小时到数十小时的长程 agentic 任务(他做过让模型连跑 48 小时的实验)。第三方转述的 KingBench 3 榜单(2026-06)中:Fable 5 88.57、Opus 4.8 87.14、GLM-5.2 81.43、Opus 4.7 55.71、GPT-5.5 38.57——评分差距拉得很开,反映其偏好「完成度与品味」而非「差不多能跑」。
沿革
- 2025:以「Agentic Evaluations」形式在社区流传,MiniMax M2 等模型的实跑成绩引发讨论
- 2026-04:KingBench 2.0 题目用于 GPT-5.5 / DeepSeek V4 Pro / Opus 4.7 横评(创作者视频)
- 2026-06-13:KingBench 3 评测 GLM-5.2 等新模型,榜单被社区广泛转述
- 2026-07:Agent 方向做长程实验:让 Kimi K3 连续运行 48 小时测自主性