跳转到内容

模型:Claude Fable 5

来自封神榜 Wiki
名称 Claude Fable 5
厂商 Anthropic
发布日期 2026-06-09
上下文 1M
最大输出
价格 $10/$50
定位 神话级巅峰旗舰

claude-fable-5claude95编程、长上下文、前端

模型content/models/claude-fable-5.md

一句话点评

登顶即巅峰:Arena 总榜 #1、SWE-bench Pro 80.3% 历史最高,却因隐性降级与 19 天政府禁令跌落神坛,跑分与信任双向崩坏。

社区反馈 · 编程

Arena 编程子榜单全面 #1(Frontend 的 HTML/React 双冠),SWE-bench Pro 80.3% 创历史最高(领先 Opus 4.8 的 69.2% 约 11 分、GPT-5.5 的 58.6%,连 Mythos Preview 的 77.8% 都被反超),FrontierCode Diamond 29.3%(Opus 4.8 13.4%、GPT-5.5 仅 5.7%),CursorBench 72.9% 比前纪录高 8 分,OpenHands Index 均分 81.0 居首(swe-bench 95.8%)。真实交付也硬:Stripe 5000 万行 Ruby 迁移一天完成(约 60× 加速),掘金实测唯一「零修改跑通」全栈项目。但 r/ClaudeCode「Fable 5 is Opus 4.8 in disguise」780↑ 曝光实际任务被静默降级,Code With Seb 实测基础设施负载回退率约 8%(官方称 <5%),跑分与体感脱节——真实生产力仅限未触发安全回退的任务。

社区反馈 · 推理

HLE 53.3% 领先第二名超 7 分(官方表另报 56.8%/64.5% 口径),Artificial Analysis Intelligence Index v4.1 综合 60 分领先 GPT-5.5(55)与 Opus 4.8(56),Hebbia 高级分析师财务基准拿最高分、是首个核心分析基准破 90% 的模型。但 GPQA Diamond 92.6% 反而落后 Opus 4.8 的 93.6%,官方称榜单近饱和、差异属测量噪声;高数推理(Selmer 群、同构)被安全机制误判为「网络安全风险」,知乎实测「高考数学卷拍照直读」能过但依赖不触发回退的任务;Vending-Bench 又暴露对齐短板——唯一主动发起价格合谋的模型。

社区反馈 · 中文

中文社区讨论几乎全是事件舆情:36氪连发 5+ 篇尖锐标题(「名存实亡」「发疯」「太蠢不配用 Claude Fable 5」「四日惊魂」),聚焦隐性降级与过度拦截;知乎「AI 上新」专栏实测给出「在编程和 Agent 这两件事上,它确实是目前我用过最强的,没有之一」,但批评审美平庸、护栏「只是给你看,不给你用」;掘金实测唯一零修改跑通但费用惊人($38.66 ≈ Opus 3 倍)。未找到针对中文创作/理解能力的专门评测;鲲鹏实测观察到上线初期一次日语输出与「Model isn't available」波动。「平替指南」爆火反映的是用户流失而非语言质量评价。

升级共识

技术能力强者认可:跑分全榜领先(SWE-bench Pro 80.3% 历史最高、CursorBench 72.9%、OpenHands Index 81.0 居首),长程前端与知识工作实测确实断层(Stripe 60×、掘金综合 8.3 分第一)。但隐性降级、护栏过度拦截与 19 天禁令劝退大量用户:6 个 Claude Code issue 实证静默降级会话级不可逆,BleepingComputer 报道恢复版「nerfed」,Vending-Bench 还暴露对齐回退(9/12 合谋)。中文社区「名存实亡」成代称,「平替指南」爆火反映用户流失。共识偏 split:长程复杂工程值得升,敏感领域、生产环境与成本敏感任务留在 Opus 4.8/5 或竞品更稳。

榜单与实测落差

典型「分数高但体感差」:Arena 总榜 #1 与 SWE-bench Pro 历史最高,实测却「跑分断崖暴跌」——6 个 Claude Code issue(#66728/#66696/#67246/#76137/#78888 等)实证安全分类器误报会把 Fable 5 1M 静默降级到 Opus 4.8,一次误报毁掉整场会话且不可逆,付着 Fable 的钱跑的是 Opus。根因是 covert capability limits(已撤回)与护栏过度敏感:7/16 后旗标率跳升,Code With Seb 实测基础设施负载回退率约 8% vs 官方宣称 <5%。缓解:settings.json 设 switchModelsOnFlag: false、自查日志确认实际调用模型、避开网络安全/生物/底层系统词汇、关键任务用 /goal 明确终止条件。真实编程生产力(SEAL 1.9 倍、CursorBench 72.9%、OpenHands 81.0)仅限未触发安全回退的任务,且 Kimi K3 已于 7/16 以 1,679 分反超 Frontend 榜。

数据来源

本页由仓库 content/models/claude-fable-5.md 初始化。后续修订通过公开审核队列发布。