跳转到内容

测试集:Aider Polyglot

来自封神榜 Wiki
名称 Aider Polyglot
类别 coding
主办方 Aider(Paul Gauthier)
开源状态 open
网址 官方页面

aider-polyglot88225 道六语言难题、Exercism 高难度题、pass@2 允许一次重试、要求指定编辑格式、选题由强模型互卷筛出

测试集content/benchmarks/aider-polyglot.md

一句话

六语言高难度代码编辑考试,来自 Aider 编辑器

测什么

AI 编程工具 Aider 的作者做的实战向评测,2024-12 推出,用来接替已经饱和的旧版(旧版 133 道 Python 题被顶尖模型刷到 84%+,榜首之间只差一两题)。从 Exercism 练习平台在 C++、Go、Java、JavaScript、Python、Rust 六种语言下的 697 道题里,只留最难的 225 道。除了考「把题做对」,还考模型能否严格按指定的编辑格式输出改动(diff 还是整文件重写)——后者直接决定 AI 工具能不能把模型的输出可靠地落到代码上,是别的榜不测的实战指标。

怎么测

选题方式本身就是个实验:先让 7 个当时的强模型(Sonnet、o1 Mini、DeepSeek、GPT-4o 等)把 697 题全做一遍,然后只保留「至多 3 个模型做对」的 225 题,确保题目对顶尖模型也有区分度(Java 47、JavaScript 49、Go 39、Python 34、Rust 30、C++ 26)。计分用 pass@2:模型第一次尝试失败后,能看到测试运行的反馈再试一次,两次内做对算过。同时报告编辑格式正确率——输出不符合要求的编辑格式,工具根本没法应用。

典型任务

题目就是 Exercism 上的高难度练习,比如 Rust 里实现一个需要手写生命周期和错误处理的解析器,或 Java 里实现一个带并发约束的数据结构。过程很像真实结对编程:Aider 把题目要求喂给模型,模型以约定的编辑格式返回代码改动,工具把改动写进文件并跑测试;如果测试挂了,失败输出会回传给模型,让它看着报错再修一次——第二次机会正是 pass@2 里那个「2」。

分数怎么看

出题时把难度校准到当时的顶级模型只得 5%–50%(o1 首发成绩 61.7%),留足上升空间。而如今头部模型已到约 88%(gpt-5 high 档 88.0%),这一关在发布不到两年后也接近被攻破。看榜单时两个数字要一起看:正确率之外的「编辑格式正确率」低的模型,在真实工具里往往不好用。

含金量与局限

别和 Aider 旧版的单语言 Python 榜混用,两套题量和计分口径都不一样。另外它是工具作者的「主场」评测:pass@2 的重试机制和编辑格式要求都服务于 Aider 的工作流,分数反映的是「在 Aider 式结对编程里的表现」,外推到其他 agent 框架时要打个折扣。

冷知识

它的出题方式是「让模型互卷」:先让 7 个当时的强模型把 697 道题全做一遍,258 道被全员做对的直接扔掉,只保留至多 3 个模型做对的 225 道——考题难度是模型们自己「投票」投出来的。

数据来源

本页由仓库 content/benchmarks/aider-polyglot.md 初始化。后续修订通过公开审核队列发布。