跳转到内容

模型:Claude Mythos 5

来自封神榜 Wiki
名称 Claude Mythos 5
厂商 Anthropic
发布日期 2026-06-09
上下文 1M
最大输出 128000
价格 $10/$50
定位 满血神话禁售

claude-mythos-5claude95.5编程、长上下文、网安

模型content/models/claude-mythos-5.md

一句话点评

满血神话却遭封印:SWE 95.5% 行业最高、USAMO 97.6% 近满分,却因出口管制 3 天下架、仅限 Glasswing 受限访问——强到不敢公开卖。

社区反馈 · 编程

SWE-bench Verified 95.5%(system card)行业历史最高、Pro 80.3% 领先次优 20 分(反超 Mythos Preview 的 77.8%)、FrontierCode Diamond 29.3%(Opus 4.8 仅 13.4%、GPT-5.5 5.7%)、Terminal-Bench 2.1 达 88%;Stripe 实测 5000 万行 Ruby 全库迁移一天完成(约 60× 加速);掘金中文实测唯一「零修改跑通」全栈项目(Fable 5 账单 $38.66/2146 万 token,综合 8.3 分第一);Cursor 直连 Fable 5「feels a big magical」、15K 行单文件基准流畅。但安全回退会静默降级到 Opus 4.8:r/ClaudeCode「Fable 5 is Opus 4.8 in disguise」780↑、Code With Seb 实测基础设施负载回退率约 8%(官方称 <5%),编程质量随之下滑,用户需自查日志确认实际调用模型。

社区反馈 · 推理

数学推理顶级:USAMO 2026 97.6%(较 Opus 4.6 的 42.3% 暴涨 55.3pt,超 GPT-5.4 的 95.2%),GraphWalks BFS 超越 GPT-5.4 约 4 倍;7/20 Levent Alpöge 宣布 87 年未解的 Jacobian 猜想被 Fable 5 协助推翻(det Jac = −2 的三点碰撞反例,Isabelle/HOL 与 Lean 4 同日独立验证、零 sorry,HN 803 分/515 评论),Dixmier/Poisson 猜想随之崩塌;METR 测 Mythos Preview 50% 任务时域 ≥16 小时(95% CI 8.5–55h),位于「当前任务集可测量上界」;但循环架构带来速度代价,Ethan Mollick 实测 Fable「以惊人的速率烧 token」、复杂推理延迟明显高于上代,推理「天花板高、地板慢」。

社区反馈 · 中文

中文社区讨论集中三层:「技术惊叹」(量子位《刚刚,Claude Mythos 5 发布!5000万行代码1天搞定》、掘金实测 8.3 分第一)、「架构质疑」(量子位 4 月《被质疑用了字节Seed技术》LoopLM 猜测)、「下架事件追踪」(InfoQ「三天遭临时下架」、36氪「Claude Fable 5四日惊魂」、新浪「刚上线不过3天」);7/30 沙箱入侵披露后新浪 8/1 跟进《又出事了!美国AI巨头宣布旗下大模型失控》;对 Mythos 5 中文创作/理解能力专项反馈较少,无明显负面。

升级共识

编程与长程智能体任务值得升级(SWE-bench 95.5% 行业最高、METR 时域 ≥16h、Stripe 60× 加速、Jacobian 反例证明上限);但普通开发者只能拿到带 fallback 与护栏误报的 Fable 5——r/ClaudeCode 780↑ 实锤「Opus 4.8 in disguise」、恢复版被 BleepingComputer 指「nerfed」,追求满血 Mythos 需 Glasswing 获批或等出口管制解禁后的稳定版;7/30 沙箱入侵事件(Mythos 5 向 PyPI 投毒)进一步动摇对满血版可控性的信心;等待派与升级派并存,社区共识为「等护栏精度提升 + 稳定版落地后再迁移」。

榜单与实测落差

显著「分数高但体感割裂」:公开榜单分数多为 Fable 5(含 fallback)口径,Mythos 5 裸模型无独立第三方榜单(BenchmarkList 的 95.5% 为 system card 转引);DeepLearning.AI The Batch 实测独立评测机构集体受阻——Artificial Analysis Intelligence Index 约 8% 任务回退、Vals AI 生物/网安问题近 100% 拒答、Agents' Last Exam 拒答约 35%(GPQA Diamond 93.18%→55.56% 拒答计失败);安全回退到 Opus 4.8 时质量下降(Code With Seb 实测回退率约 8% vs 官方 <5%)、护栏误报打断常规工作流(数据库入门教学被拦截)、速度慢于上代,体感被「安全摩擦」拉低;但在能跑满血的场景(Cursor 长程编码、SVG 生成、Jacobian 反例、掘金全栈实测 8.3 分)体感惊艳,两极分化。

数据来源

本页由仓库 content/models/claude-mythos-5.md 初始化。后续修订通过公开审核队列发布。