跳转到内容

测试集:Frontier-Bench

来自封神榜 Wiki
名称 Frontier-Bench
类别 coding
主办方 Anthropic(内部基准,随 2026 Opus 系列发布披露)
开源状态 closed
网址 官方页面

frontier-bench43.5终端长时程工程任务、Agent 独立尝试 5 次取均值、含 FreeCAD 建模等非常规工具链、厂商内部运行不可复现、2026-07 随 Opus 5 披露

测试集content/benchmarks/frontier-bench.md

一句话

Anthropic 内部的终端编程 agent 考试

测什么

Frontier-Bench 是 Anthropic 的内部 agentic 编程基准,随 2026 年 Opus 新模型发布对外披露,目前是 v0.1。它测的是 agent 在终端里完成长时程工程任务的能力,题目超出普通修 bug 的范畴,包含一些需要不常见工具链的任务,比如把一个零件重建成 FreeCAD 3D 模型。它存在的理由很直接:上一代终端类榜单头部模型已经挤在一团,分不出高下。

怎么测

评测统一用 mini-SWE-agent harness,跑在 Anthropic 自己的 GKE 后端上。每个任务让 agent 独立尝试 5 次,取平均奖励(mean reward)作为得分,分数落在 0–1 区间。整个过程由 Anthropic 内部运行,外部只能看到发布材料里的结果。

典型任务

官方披露的典型任务画像是「长时程 + 不寻常工具」:agent 不是补个函数,而是要在终端里连续工作,完成诸如用 FreeCAD 把一个实体零件重建为 3D 模型这类跨软件、跨领域的工程活。这类任务没有标准化解法模板,考的是探索工具、反复试错、把一整件事做成的综合能力。

分数怎么看

按 Anthropic 自报口径,Opus 5 以约 0.43(43.5%)领跑,大约是 Opus 4.8(约 21%)的两倍,第三方聚合站 llm-stats 收录的榜首也是 0.433。发布材料还给出「分数—单次任务成本」曲线:Opus 5 在约 14–15 美元/次达到约 44% 的天花板。目前它主要用于 Anthropic 自家模型的纵向比较。

含金量与局限

v0.1 阶段一切分数都是厂商自报:无独立论文、任务集不公开、外部无法复现,媒体转述的数字都源自同一份发布材料。另外务必别和 Epoch AI 的 FrontierMath(数学基准)混淆,两者除了名字都带 Frontier 毫无关系。

冷知识

一个耐人寻味的细节:Anthropic 的脚注写明,Opus 5 跑榜时如果安全分类器拒绝了请求,兜底替跑的竟是 Opus 4.8——同一张榜上新旧两代模型其实在同一场考试里「接力」。另外别被名字骗了:它和 Epoch AI 的数学榜 FrontierMath 没有任何关系。

数据来源

本页由仓库 content/benchmarks/frontier-bench.md 初始化。后续修订通过公开审核队列发布。