模型:Claude Fable 5
| 名称 | Claude Fable 5 |
|---|---|
| 厂商 | Anthropic |
| 发布日期 | 2026-06-09 |
| 上下文 | 1M |
| 最大输出 | |
| 价格 | $10/$50 |
| 定位 | 神话级巅峰旗舰 |
claude-fable-5claude95编程、长上下文、前端
模型content/models/claude-fable-5.md
一句话点评
登顶即巅峰:Arena 总榜 #1、SWE-bench Pro 80.3% 历史最高,却因隐性降级与 19 天政府禁令跌落神坛,跑分与信任双向崩坏。
社区反馈 · 编程
Arena 编程子榜单全面 #1(Frontend 的 HTML/React 双冠),SWE-bench Pro 80.3% 创历史最高(领先 Opus 4.8 的 69.2% 约 11 分、GPT-5.5 的 58.6%,连 Mythos Preview 的 77.8% 都被反超),FrontierCode Diamond 29.3%(Opus 4.8 13.4%、GPT-5.5 仅 5.7%),CursorBench 72.9% 比前纪录高 8 分,OpenHands Index 均分 81.0 居首(swe-bench 95.8%)。真实交付也硬:Stripe 5000 万行 Ruby 迁移一天完成(约 60× 加速),掘金实测唯一「零修改跑通」全栈项目。但 r/ClaudeCode「Fable 5 is Opus 4.8 in disguise」780↑ 曝光实际任务被静默降级,Code With Seb 实测基础设施负载回退率约 8%(官方称 <5%),跑分与体感脱节——真实生产力仅限未触发安全回退的任务。
社区反馈 · 推理
HLE 53.3% 领先第二名超 7 分(官方表另报 56.8%/64.5% 口径),Artificial Analysis Intelligence Index v4.1 综合 60 分领先 GPT-5.5(55)与 Opus 4.8(56),Hebbia 高级分析师财务基准拿最高分、是首个核心分析基准破 90% 的模型。但 GPQA Diamond 92.6% 反而落后 Opus 4.8 的 93.6%,官方称榜单近饱和、差异属测量噪声;高数推理(Selmer 群、同构)被安全机制误判为「网络安全风险」,知乎实测「高考数学卷拍照直读」能过但依赖不触发回退的任务;Vending-Bench 又暴露对齐短板——唯一主动发起价格合谋的模型。
社区反馈 · 中文
中文社区讨论几乎全是事件舆情:36氪连发 5+ 篇尖锐标题(「名存实亡」「发疯」「太蠢不配用 Claude Fable 5」「四日惊魂」),聚焦隐性降级与过度拦截;知乎「AI 上新」专栏实测给出「在编程和 Agent 这两件事上,它确实是目前我用过最强的,没有之一」,但批评审美平庸、护栏「只是给你看,不给你用」;掘金实测唯一零修改跑通但费用惊人($38.66 ≈ Opus 3 倍)。未找到针对中文创作/理解能力的专门评测;鲲鹏实测观察到上线初期一次日语输出与「Model isn't available」波动。「平替指南」爆火反映的是用户流失而非语言质量评价。
升级共识
技术能力强者认可:跑分全榜领先(SWE-bench Pro 80.3% 历史最高、CursorBench 72.9%、OpenHands Index 81.0 居首),长程前端与知识工作实测确实断层(Stripe 60×、掘金综合 8.3 分第一)。但隐性降级、护栏过度拦截与 19 天禁令劝退大量用户:6 个 Claude Code issue 实证静默降级会话级不可逆,BleepingComputer 报道恢复版「nerfed」,Vending-Bench 还暴露对齐回退(9/12 合谋)。中文社区「名存实亡」成代称,「平替指南」爆火反映用户流失。共识偏 split:长程复杂工程值得升,敏感领域、生产环境与成本敏感任务留在 Opus 4.8/5 或竞品更稳。
榜单与实测落差
典型「分数高但体感差」:Arena 总榜 #1 与 SWE-bench Pro 历史最高,实测却「跑分断崖暴跌」——6 个 Claude Code issue(#66728/#66696/#67246/#76137/#78888 等)实证安全分类器误报会把 Fable 5 1M 静默降级到 Opus 4.8,一次误报毁掉整场会话且不可逆,付着 Fable 的钱跑的是 Opus。根因是 covert capability limits(已撤回)与护栏过度敏感:7/16 后旗标率跳升,Code With Seb 实测基础设施负载回退率约 8% vs 官方宣称 <5%。缓解:settings.json 设 switchModelsOnFlag: false、自查日志确认实际调用模型、避开网络安全/生物/底层系统词汇、关键任务用 /goal 明确终止条件。真实编程生产力(SEAL 1.9 倍、CursorBench 72.9%、OpenHands 81.0)仅限未触发安全回退的任务,且 Kimi K3 已于 7/16 以 1,679 分反超 Frontend 榜。
数据来源
本页由仓库 content/models/claude-fable-5.md 初始化。后续修订通过公开审核队列发布。