跳转到内容

测试集:CursorBench

来自封神榜 Wiki
名称 CursorBench
类别 coding
主办方 Cursor / Anysphere(3.0 于 2026-03 随 Composer 2 技术报告披露,3.1 于 2026-07)
开源状态 closed
网址 官方页面

cursorbench61.3真实 Cursor 会话抽取任务、Cursor Blame 回溯请求→提交配对、四维打分(正确性/质量/效率/交互)、混合线上 Keep Rate 指标、任务集定期刷新防背题

测试集content/benchmarks/cursorbench.md

一句话

从真实 Cursor 会话里抽的模糊多文件任务

测什么

CursorBench 是 Cursor 的内部评测套件,任务不靠人造,而是从真实 Cursor 生产会话中抽取:用一套叫 Cursor Blame 的方法把已提交的代码回溯到当初那条 agent 请求,天然得到「真实需求 → 真实结果」的配对。题目画像是工程师的日常:模糊需求、多文件改动、monorepo、多工作区环境、查生产日志、盯长时任务,覆盖编辑、重构、修 bug、理解、规划、评审六类,且任务集每隔几个月刷新一次以跟上真实用法、降低背题空间。

怎么测

不按单一总分,而是四个维度打分:解答正确性、代码质量、效率、交互行为,同时记录成本、token 消耗和 agent 步数。线下分数之外还混合线上指标——最典型的是 Keep Rate(用户最终保留 AI 所写代码的比率),并辅以受控的线上实验,专门抓「榜上高分但用户不爱用」的错位。

典型任务

任务的「真实感」体现在规格模糊:不是「给某个函数修某个 bug」,而是一条开发者口吻的模糊请求,落在一个多文件 monorepo 里,agent 要自己弄清楚该动哪几处、怎么验证。官方称从初版到 3.0,平均任务的代码行数和涉及文件数大约翻了一倍——基准在变难的速度,基本就是真实用户对 agent 要求提高的速度。

分数怎么看

分数只有相对意义:Composer 2 技术报告自报 CursorBench 61.3 分;2026-03 有 GPT-5.4 登顶 3.0 的说法;3.2 上 Anthropic 宣称 Opus 5 在 max 档位距榜首 Fable 5 不到 0.5%、且单次任务成本减半。跨版本(3.0/3.1/3.2)口径有演进,数字不能直接串着比。

含金量与局限

任务集不公开、分数全部厂商自报,外部无法独立复现,任何「某模型登顶 CursorBench」的说法追到底都是某家发布材料。它深度绑定 Cursor 自家工作流和 Keep Rate,本质是产品选型工具而非中立的学术榜单。

冷知识

它的题目不是人出的,是从自家产品里「考古」出来的:Cursor Blame 把用户仓库里已提交的代码回溯到当初那条 agent 请求,自动得到「真实需求→真实结果」的配对。Cursor 保持内部基准的理由也很坦白:榜一旦公开就会被针对优化,不公开反而是更诚实的信号。

数据来源

本页由仓库 content/benchmarks/cursorbench.md 初始化。后续修订通过公开审核队列发布。