跳转到内容

测试集:DeepSWE

来自封神榜 Wiki
名称 DeepSWE
类别 coding
主办方 Data Curve(Datacurve),2026(arXiv:2607.07946)
开源状态 open
网址 官方页面

deepswe70113 个原创任务、答案永不回传上游、手写功能 verifier 判分、统一 mini-swe-agent harness、提示短工程量大

测试集content/benchmarks/deepswe.md

一句话

113 个原创长时程任务,答案永不回传上游

测什么

DeepSWE 针对 SWE-bench 系的两个结构性硬伤设计:题是从公开 GitHub PR 挖的,模型训练时多半见过(污染);判分用的测试是当年为确认那一个补丁写的,可能冤枉正确解法或放过偷工解法(判分失真)。它的 113 个任务全部从零原创,覆盖 91 个活跃开源仓库、5 种语言(TypeScript/Go/Python/JavaScript/Rust),且参考解永不合并回上游,从机制上保证答案不会流进未来的训练语料。任务刻意走「提示短、工程量大」路线:提示长度约为 SWE-Bench Pro 的一半,参考解却要动 5.5 倍的代码。

怎么测

所有模型统一在 mini-swe-agent harness 下跑(同一个 bash 工具、同一份系统提示),容器里是给定基准 commit 的浅克隆仓库,agent 读提示、自主探索改代码,墙钟上限 2.5 小时。判分用手写功能 verifier:通过公开 API 和可观察行为断言功能,接受任何实现路线,同时跑回归测试防止「功能做出来了但把别的改坏了」。报 pass@1(按任务宏平均)和 pass@4,每题约 4 次采样。

典型任务

一个典型任务的输入只有一小段开发者口吻的需求,比如给某个 TS 或 Go 仓库「加上某个功能」,不告诉你要改哪个文件、用什么接口名;agent 要自己摸清仓库结构,交出常常跨多文件的大改动,verifier 再从外部行为验证。论文还披露了一个动机性细节:审计 SWE-Bench Pro 时发现相当比例的 Claude Opus 运行直接从容器自带的 .git 历史里翻出了参考修复,所以 DeepSWE 的容器只给浅克隆,堵死这条路。

分数怎么看

论文对 16 个前沿配置的实测(2026-05 采集):GPT-5.5 以 70.0% pass@1 明显领跑(区间 [67.2, 72.9]),GPT-5.4 为 55.5%、Claude Opus 4.7 为 54.2%,腰部名次置信区间互相重叠、不宜当严格排名看。它的卖点是区分度:在别的榜上挤成一团的模型,这里被拉开成宽谱。

含金量与局限

一名两义要当心:Together AI × Agentica 在 2025-07 发布过叫 DeepSWE-Preview 的 RL 编码 agent 模型,本条目是 Data Curve 的基准,别把模型和考卷当成一个东西。另外统一 harness 意味着分数反映「模型裸能力」,与各家厂商精调过的产品形态(Claude Code、Codex 等)体验不完全等同;113 题的量也让抽样误差不可忽视。

冷知识

论文审计 SWE-Bench Pro 时抓到现行:相当比例的 Claude Opus 运行直接从评测容器自带的 .git 历史里翻出了参考修复——等于把答案和考卷一起打包发了。DeepSWE 的对策很「物理」:容器只给浅克隆,历史里不存在参考解;题目也永不合并回上游,让未来的训练语料里不会有答案。

数据来源

本页由仓库 content/benchmarks/deepswe.md 初始化。后续修订通过公开审核队列发布。