测试集:Aider Polyglot
| 名称 | Aider Polyglot |
|---|---|
| 类别 | coding |
| 主办方 | Aider(Paul Gauthier) |
| 开源状态 | open |
| 网址 | 官方页面 |
aider-polyglot88225 道六语言难题、Exercism 高难度题、pass@2 允许一次重试、要求指定编辑格式、选题由强模型互卷筛出
测试集content/benchmarks/aider-polyglot.md
一句话
六语言高难度代码编辑考试,来自 Aider 编辑器
测什么
AI 编程工具 Aider 的作者做的实战向评测,2024-12 推出,用来接替已经饱和的旧版(旧版 133 道 Python 题被顶尖模型刷到 84%+,榜首之间只差一两题)。从 Exercism 练习平台在 C++、Go、Java、JavaScript、Python、Rust 六种语言下的 697 道题里,只留最难的 225 道。除了考「把题做对」,还考模型能否严格按指定的编辑格式输出改动(diff 还是整文件重写)——后者直接决定 AI 工具能不能把模型的输出可靠地落到代码上,是别的榜不测的实战指标。
怎么测
选题方式本身就是个实验:先让 7 个当时的强模型(Sonnet、o1 Mini、DeepSeek、GPT-4o 等)把 697 题全做一遍,然后只保留「至多 3 个模型做对」的 225 题,确保题目对顶尖模型也有区分度(Java 47、JavaScript 49、Go 39、Python 34、Rust 30、C++ 26)。计分用 pass@2:模型第一次尝试失败后,能看到测试运行的反馈再试一次,两次内做对算过。同时报告编辑格式正确率——输出不符合要求的编辑格式,工具根本没法应用。
典型任务
题目就是 Exercism 上的高难度练习,比如 Rust 里实现一个需要手写生命周期和错误处理的解析器,或 Java 里实现一个带并发约束的数据结构。过程很像真实结对编程:Aider 把题目要求喂给模型,模型以约定的编辑格式返回代码改动,工具把改动写进文件并跑测试;如果测试挂了,失败输出会回传给模型,让它看着报错再修一次——第二次机会正是 pass@2 里那个「2」。
分数怎么看
出题时把难度校准到当时的顶级模型只得 5%–50%(o1 首发成绩 61.7%),留足上升空间。而如今头部模型已到约 88%(gpt-5 high 档 88.0%),这一关在发布不到两年后也接近被攻破。看榜单时两个数字要一起看:正确率之外的「编辑格式正确率」低的模型,在真实工具里往往不好用。
含金量与局限
别和 Aider 旧版的单语言 Python 榜混用,两套题量和计分口径都不一样。另外它是工具作者的「主场」评测:pass@2 的重试机制和编辑格式要求都服务于 Aider 的工作流,分数反映的是「在 Aider 式结对编程里的表现」,外推到其他 agent 框架时要打个折扣。
冷知识
它的出题方式是「让模型互卷」:先让 7 个当时的强模型把 697 道题全做一遍,258 道被全员做对的直接扔掉,只保留至多 3 个模型做对的 225 道——考题难度是模型们自己「投票」投出来的。
数据来源
本页由仓库 content/benchmarks/aider-polyglot.md 初始化。后续修订通过公开审核队列发布。