跳转到内容

测试集:CC-Bench

来自封神榜 Wiki
名称 CC-Bench
类别 coding
主办方 智谱 Z.ai,随 GLM-4.5(2025-07)公开,GLM-4.6 扩展为 CC-Bench-V2
开源状态 open
网址 官方页面

cc-bench48.6真实 Claude Code 框架、两两对决胜率、真人评估员判分、隔离 Docker 容器、厂商自建自评

测试集content/benchmarks/cc-bench.md

一句话

把模型装进 Claude Code,真人评判谁干活更好

测什么

智谱为衡量「模型在真实 agent 编程框架里干活」的能力自建的测试集。它不跑自动化测试判对错,而是把候选模型接入 Claude Code 这个真实的 agent 编程平台,在独立 Docker 容器里完成多轮真实编程任务,重点考察工具调用的稳定性和任务完成质量。GLM-4.5 时期为 52 个任务、六大开发方向;GLM-4.6 时扩充为 CC-Bench-V2,并拆出前端/后端子榜。

怎么测

评测采用两两对决:同一批任务分别让两个模型在 Claude Code 里跑,由真人评估员对比两者的产出,报胜率(win rate),同时统计 token 消耗作为效率指标。所有实验在隔离容器中进行,评估细节和四个模型(GLM-4.5、Claude-4-Sonnet、Kimi-K2、Qwen3-Coder)在全部任务上的完整 agent 交互轨迹都公开在 HuggingFace 上(zai-org/CC-Bench-trajectories)。

典型任务

任务覆盖前端开发、工具开发、数据分析、测试、算法实现等六大类。比如前端类任务要求模型用 HTML5/CSS3/JavaScript 从零搭出一个可交互页面;工具开发类则要求写出一个能实际运行的命令行或小工具。模型不是一次性输出代码,而是在 Claude Code 里像真人程序员一样多轮操作:读需求、建文件、跑命令、看报错、改代码,评估员最后对比两个模型谁交付的东西更能用。

分数怎么看

看胜率而不是绝对分:50% 意味着和对手打平。GLM-4.5 对 Kimi K2 的胜率为 53.9%;GLM-4.6 对 Claude Sonnet 4 的胜率 48.6%(基本打平),同时 token 消耗比 GLM-4.5 少约 15%。这个榜的价值在于它测的是「装进真实工具链后的综合表现」,而非孤立代码题。

含金量与局限

这是厂商自建自评的基准,对决评判由智谱组织,存在主场倾向,胜率为自报数据。名字容易撞车:ccbench.org 是另一个独立的小代码库编码 agent 评测,本站此条指智谱版。此外 V1(52 任务)与 V2(扩充版、分前后端子榜)的结果不可直接对比。

冷知识

这个榜的「考场」是对手家的产品:智谱把各家模型统统装进 Anthropic 的 Claude Code 里,再和 Claude 本家模型同台对决——用别人的擂台打自己的比赛。更难得的是四个模型在全部任务上的每一步操作轨迹都公开了,任何人都能复盘它们是怎么干活(和翻车)的。

数据来源

本页由仓库 content/benchmarks/cc-bench.md 初始化。后续修订通过公开审核队列发布。