CC-Bench 测试集档案
CC-Bench 测试集中文档案:把模型装进 Claude Code,真人评判谁干活更好 由 智谱 Z.ai,随 GLM-4.5(2025-07)公开,GLM-4.6 扩展为 CC-Bench-V2 组织,包含测试方法、典型任务、分数解读、沿革与局限。
- CC-Bench
- CC-Bench 实测
- 智谱 Z.ai,随 GLM-4.5(2025-07)公开,GLM-4.6 扩展为 CC-Bench-V2
已发布事实
- 发布方
- 智谱 Z.ai
- 首发
- 2025-07 随 GLM-4.5 公开
- 任务规模
- V1 52 个任务、六大方向;V2 扩充并拆前端/后端子榜
- 评测平台
- Claude Code 框架 + 隔离 Docker 容器
- 计分
- 真人评估两两对决胜率 + token 消耗
- 数据公开
- 完整 agent 轨迹在 HuggingFace(zai-org/CC-Bench-trajectories)
它测什么
智谱为衡量「模型在真实 agent 编程框架里干活」的能力自建的测试集。它不跑自动化测试判对错,而是把候选模型接入 Claude Code 这个真实的 agent 编程平台,在独立 Docker 容器里完成多轮真实编程任务,重点考察工具调用的稳定性和任务完成质量。GLM-4.5 时期为 52 个任务、六大开发方向;GLM-4.6 时扩充为 CC-Bench-V2,并拆出前端/后端子榜。
怎么测
评测采用两两对决:同一批任务分别让两个模型在 Claude Code 里跑,由真人评估员对比两者的产出,报胜率(win rate),同时统计 token 消耗作为效率指标。所有实验在隔离容器中进行,评估细节和四个模型(GLM-4.5、Claude-4-Sonnet、Kimi-K2、Qwen3-Coder)在全部任务上的完整 agent 交互轨迹都公开在 HuggingFace 上(zai-org/CC-Bench-trajectories)。
分数怎么看
看胜率而不是绝对分:50% 意味着和对手打平。GLM-4.5 对 Kimi K2 的胜率为 53.9%;GLM-4.6 对 Claude Sonnet 4 的胜率 48.6%(基本打平),同时 token 消耗比 GLM-4.5 少约 15%。这个榜的价值在于它测的是「装进真实工具链后的综合表现」,而非孤立代码题。
局限
这是厂商自建自评的基准,对决评判由智谱组织,存在主场倾向,胜率为自报数据。名字容易撞车:ccbench.org 是另一个独立的小代码库编码 agent 评测,本站此条指智谱版。此外 V1(52 任务)与 V2(扩充版、分前后端子榜)的结果不可直接对比。
典型任务
任务覆盖前端开发、工具开发、数据分析、测试、算法实现等六大类。比如前端类任务要求模型用 HTML5/CSS3/JavaScript 从零搭出一个可交互页面;工具开发类则要求写出一个能实际运行的命令行或小工具。模型不是一次性输出代码,而是在 Claude Code 里像真人程序员一样多轮操作:读需求、建文件、跑命令、看报错、改代码,评估员最后对比两个模型谁交付的东西更能用。
沿革
- 2025-07-28:随 GLM-4.5 发布首次公开:52 任务、六大方向,GLM-4.5 / Claude-4-Sonnet / Kimi-K2 / Qwen3-Coder 四模型对决
- 2025-07:全部 52 任务的完整交互轨迹数据集公开至 HuggingFace,供社区复盘
- 2025-09:随 GLM-4.6 扩充为更难的任务集(CC-Bench-V2),拆出前端/后端子榜,报出对 Claude Sonnet 4 的 48.6% 胜率