跳转到内容

模型:Claude Opus 4.8

来自封神榜 Wiki
名称 Claude Opus 4.8
厂商 Anthropic
发布日期 2026-05-28
上下文 200k
最大输出
价格 $5/$25
定位 诚实校准旗舰

claude-opus-4-8claude88.6诚实、编程、Agent

模型content/models/claude-opus-4-8.md

一句话点评

跑分与诚实双升的「圣贤」旗舰——SWE 领先却体感分裂,蒸馏争议缠身,需 goal-first 重新调教。

社区反馈 · 编程

极度两极分化:SWE-bench Pro 69.2% 领先 GPT-5.5(58.6%)、LMArena coding 登顶、stet.sh 50 PR 实测双语言 craft leader(test gate 47/50);但 HN「连文件都读不了」连错 15 次(Ask HN id=48316636,9 pts)、知乎称 agent coding 更易犯错;Nick Sweeting 实录模型把 120ms 编成 2.4ms(差 50 倍)。Daniel Johnston 反向佐证:「两个 codebase 每日审查,昨天第一次双双零幻觉报错」;uygarduzgun 生产实测 4.8 修掉 Codex 修不好的冷加载 bug 并自装 MutationObserver 验证。跑分与体感落差疑似与 effort level 强依赖(Every.to:extra-high 63 vs high 42)。

社区反馈 · 推理

goal-first framing 下复杂规划被认可增强(Reddit「Changed my mind」帖);但 Andon Labs 实测 Max effort 推理 token 约为 4.7 Max 的 5 倍、压缩超 2 倍,长任务反而失忆;zero-shot 知识问答被指弱于 4.7;Handwritten-edit 基准 4.8 在 miscounting 上 regress 55%(Fable 5 #1);ARC-AGI-3 得 1.5% 创当时 SOTA(ARC Prize,6/1)。

社区反馈 · 中文

无专项评测,社区以编程/Agent 讨论为主;蒸馏争议中中文身份问答异常(自称千问/DeepSeek),侧面反映中文语料与身份对齐存在瑕疵;Zvi 还记录「研究线程里随机冒中文」(@nickcammarata),纯中文创作口碑缺失。

升级共识

诚实度+对齐+跑分是实打实的进步(漏报概率 1/4、拦截测试 0 失分、SWE-bench Pro 69.2%),值得升级;但需重学 goal-first prompting,Max effort 长任务慎用(推理 token 约 5 倍、压缩超 2 倍伤记忆),官方建议编码显式设 xhigh。重度编码用户体感分裂:Every.to 团队与 stet.sh 站队 4.8(「该叫 Opus 5」、craft leader),HN/知乎派嫌体感差回退 4.6;8 月回流帖甚至出现「4.8 > Opus 5」。轻度用户建议留在 4.6 或等 Opus 5。

榜单与实测落差

SWE-bench Pro/Verified 双高、stet.sh 50 PR craft leader、OpenHands Index 71.88 排 #2,HN/Reddit/知乎却大量报文件读取失败、路径幻觉、编造性能数据——典型「分数高体感差」。根因是神级表现病态依赖 Effort Level:Max 档推理 token 约 5 倍、压缩超 2 倍致长任务失忆(Andon Labs),Every.to 实测 extra-high 63 vs high 42 佐证。缓解:High/extra-high effort + goal-first framing,高危管线务必加 injection 防护(无防护 7% vs 4.7 的 2.3%)。

数据来源

本页由仓库 content/models/claude-opus-4-8.md 初始化。后续修订通过公开审核队列发布。