测试集:CC-Bench
| 名称 | CC-Bench |
|---|---|
| 类别 | coding |
| 主办方 | 智谱 Z.ai,随 GLM-4.5(2025-07)公开,GLM-4.6 扩展为 CC-Bench-V2 |
| 开源状态 | open |
| 网址 | 官方页面 |
cc-bench48.6真实 Claude Code 框架、两两对决胜率、真人评估员判分、隔离 Docker 容器、厂商自建自评
测试集content/benchmarks/cc-bench.md
一句话
把模型装进 Claude Code,真人评判谁干活更好
测什么
智谱为衡量「模型在真实 agent 编程框架里干活」的能力自建的测试集。它不跑自动化测试判对错,而是把候选模型接入 Claude Code 这个真实的 agent 编程平台,在独立 Docker 容器里完成多轮真实编程任务,重点考察工具调用的稳定性和任务完成质量。GLM-4.5 时期为 52 个任务、六大开发方向;GLM-4.6 时扩充为 CC-Bench-V2,并拆出前端/后端子榜。
怎么测
评测采用两两对决:同一批任务分别让两个模型在 Claude Code 里跑,由真人评估员对比两者的产出,报胜率(win rate),同时统计 token 消耗作为效率指标。所有实验在隔离容器中进行,评估细节和四个模型(GLM-4.5、Claude-4-Sonnet、Kimi-K2、Qwen3-Coder)在全部任务上的完整 agent 交互轨迹都公开在 HuggingFace 上(zai-org/CC-Bench-trajectories)。
典型任务
任务覆盖前端开发、工具开发、数据分析、测试、算法实现等六大类。比如前端类任务要求模型用 HTML5/CSS3/JavaScript 从零搭出一个可交互页面;工具开发类则要求写出一个能实际运行的命令行或小工具。模型不是一次性输出代码,而是在 Claude Code 里像真人程序员一样多轮操作:读需求、建文件、跑命令、看报错、改代码,评估员最后对比两个模型谁交付的东西更能用。
分数怎么看
看胜率而不是绝对分:50% 意味着和对手打平。GLM-4.5 对 Kimi K2 的胜率为 53.9%;GLM-4.6 对 Claude Sonnet 4 的胜率 48.6%(基本打平),同时 token 消耗比 GLM-4.5 少约 15%。这个榜的价值在于它测的是「装进真实工具链后的综合表现」,而非孤立代码题。
含金量与局限
这是厂商自建自评的基准,对决评判由智谱组织,存在主场倾向,胜率为自报数据。名字容易撞车:ccbench.org 是另一个独立的小代码库编码 agent 评测,本站此条指智谱版。此外 V1(52 任务)与 V2(扩充版、分前后端子榜)的结果不可直接对比。
冷知识
这个榜的「考场」是对手家的产品:智谱把各家模型统统装进 Anthropic 的 Claude Code 里,再和 Claude 本家模型同台对决——用别人的擂台打自己的比赛。更难得的是四个模型在全部任务上的每一步操作轨迹都公开了,任何人都能复盘它们是怎么干活(和翻车)的。
数据来源
本页由仓库 content/benchmarks/cc-bench.md 初始化。后续修订通过公开审核队列发布。