模型:Claude Opus 4.8
| 名称 | Claude Opus 4.8 |
|---|---|
| 厂商 | Anthropic |
| 发布日期 | 2026-05-28 |
| 上下文 | 200k |
| 最大输出 | |
| 价格 | $5/$25 |
| 定位 | 诚实校准旗舰 |
claude-opus-4-8claude88.6诚实、编程、Agent
模型content/models/claude-opus-4-8.md
一句话点评
跑分与诚实双升的「圣贤」旗舰——SWE 领先却体感分裂,蒸馏争议缠身,需 goal-first 重新调教。
社区反馈 · 编程
极度两极分化:SWE-bench Pro 69.2% 领先 GPT-5.5(58.6%)、LMArena coding 登顶、stet.sh 50 PR 实测双语言 craft leader(test gate 47/50);但 HN「连文件都读不了」连错 15 次(Ask HN id=48316636,9 pts)、知乎称 agent coding 更易犯错;Nick Sweeting 实录模型把 120ms 编成 2.4ms(差 50 倍)。Daniel Johnston 反向佐证:「两个 codebase 每日审查,昨天第一次双双零幻觉报错」;uygarduzgun 生产实测 4.8 修掉 Codex 修不好的冷加载 bug 并自装 MutationObserver 验证。跑分与体感落差疑似与 effort level 强依赖(Every.to:extra-high 63 vs high 42)。
社区反馈 · 推理
goal-first framing 下复杂规划被认可增强(Reddit「Changed my mind」帖);但 Andon Labs 实测 Max effort 推理 token 约为 4.7 Max 的 5 倍、压缩超 2 倍,长任务反而失忆;zero-shot 知识问答被指弱于 4.7;Handwritten-edit 基准 4.8 在 miscounting 上 regress 55%(Fable 5 #1);ARC-AGI-3 得 1.5% 创当时 SOTA(ARC Prize,6/1)。
社区反馈 · 中文
无专项评测,社区以编程/Agent 讨论为主;蒸馏争议中中文身份问答异常(自称千问/DeepSeek),侧面反映中文语料与身份对齐存在瑕疵;Zvi 还记录「研究线程里随机冒中文」(@nickcammarata),纯中文创作口碑缺失。
升级共识
诚实度+对齐+跑分是实打实的进步(漏报概率 1/4、拦截测试 0 失分、SWE-bench Pro 69.2%),值得升级;但需重学 goal-first prompting,Max effort 长任务慎用(推理 token 约 5 倍、压缩超 2 倍伤记忆),官方建议编码显式设 xhigh。重度编码用户体感分裂:Every.to 团队与 stet.sh 站队 4.8(「该叫 Opus 5」、craft leader),HN/知乎派嫌体感差回退 4.6;8 月回流帖甚至出现「4.8 > Opus 5」。轻度用户建议留在 4.6 或等 Opus 5。
榜单与实测落差
SWE-bench Pro/Verified 双高、stet.sh 50 PR craft leader、OpenHands Index 71.88 排 #2,HN/Reddit/知乎却大量报文件读取失败、路径幻觉、编造性能数据——典型「分数高体感差」。根因是神级表现病态依赖 Effort Level:Max 档推理 token 约 5 倍、压缩超 2 倍致长任务失忆(Andon Labs),Every.to 实测 extra-high 63 vs high 42 佐证。缓解:High/extra-high effort + goal-first framing,高危管线务必加 injection 防护(无防护 7% vs 4.7 的 2.3%)。
数据来源
本页由仓库 content/models/claude-opus-4-8.md 初始化。后续修订通过公开审核队列发布。