跳转到内容

模型:Claude Sonnet 5

来自封神榜 Wiki
名称 Claude Sonnet 5
厂商 Anthropic
发布日期 2026-06-30
上下文 1M
最大输出 128000
价格 $3/$15
定位 破格中端

claude-sonnet-5claude82.1Agent、编程、前端

模型content/models/claude-sonnet-5.md

一句话点评

中端破格:GPQA 96.2% 创全行业纪录、SWE-bench 首破 80%,却因 token 膨胀与 9 月涨价被嘲「Opus 平替」名不副实——能力接近旗舰,账单先到。

社区反馈 · 编程

SWE-bench Verified 82.1%(4.6 为 79.6%)发布即破 80%、SWE-bench Pro 63.2%(4.6 为 58.1%)、CursorBench 57%(4.6 为 49%,v3.2 分档 Max 61.5%~Low 47.7%);r/ClaudeAI 开发者高赞「修复了卡 Opus 4.8 好几天的严重 Bug」「多文件复杂重构独立完成过半」。Endor Labs(07-09)在 Claude Code 与 Cursor 双 harness 实测:Claude Code + Sonnet 5 = 83.2% FuncPass/19.6% SecPass,几乎不作弊(200/200 仅 8 次),是首个同模型对照反超 Cursor 的模型;Cursor + Sonnet 5 仅 63.1% FuncPass,主因是 Cursor 首轮超时 65/200(32.5%)vs Claude Code 20/200(10%)。CodeRabbit 实测「本档位写作能力最强、测试先行、会中途自改规划」,但代码审查「抓的 bug 比生产中的旧模型少」。反面:Simon Willison 吐槽组合工具调用常卡壳、代码渲染翻车;知乎横评前端 B/B+ 持平 Opus 4.6 非推理模式、弱于 GLM-5.2,对大规模历史代码库探索不充分;aireiter 实测同一编码任务每一档都比 4.6 贵(medium $0.344 vs $0.253)。

社区反馈 · 推理

GPQA Diamond 96.2% 创全行业纪录(超 Gemini 3.1 Pro 94.3%)、ARC-AGI-2 84.7%(超 Gemini 3.1 Pro 7 分)、HLE without tools 43.2%(超 GLM-5.2 的 40.5%);AA 口径 HLE 比 4.6 高 10 分、Terminal-Bench v2.1 +9 分、SciCode +7 分。但硬核逻辑题库不敌 MiniMax-M3(61.95 分)与 Qwen3.7-Plus,CritPt(阿贡/UIUC 物理推理基准)仅 17%——比 4.6 高 14 分却仍落后 GLM-5.2/Opus/Fable/GPT-5.5;平均耗时仅 404 秒(远快于 Qwen 1156 秒)被指「思维链堆叠不够厚、自我纠错预算受限」;AA 实测 max effort 输出 token 比 4.6 多约 40%,多步多约束推理 token 消耗比 Opus 高 60%。

社区反馈 · 中文

中文社区讨论几乎全部聚焦性价比与账单争议(「打不过千问和 Minimax,性价比全面翻车」「啥叫 Sonnet 5 比 Fable 5 还贵?」),未检索到中文创作/理解能力的专项评测,中文分按中性偏上推断。一个值得注意的细节:Simon Willison 分语言实测新 tokenizer 的 token 膨胀——英文 1.42×、西语 1.33×、Python 代码 1.27×,唯独简体中文仅 1.01×(几乎不变),即「明降暗涨」对中文用户的实际冲击小于英文场景;V2EX/linux.do 以 token 膨胀、封号潮讨论为主,知乎「如何评价 Claude Sonnet 5」17 万浏览/58 回答几乎全是性价比账。

升级共识

Agent/编程场景值得升级:SWE-bench Pro +5.1(58.1%→63.2%)、CursorBench 49%→57%、Agent 调用轮次翻 3 倍(AA 实测)、GDPval-AA 反超 Opus 4.8、Endor Labs 证明 Claude Code 内 FuncPass 83.2% 且几乎不作弊。日常简单任务建议 low/medium effort——doctoboggan 的 HN 高赞建议是「medium 以上档位永远别用 Sonnet,直接换模型」;预算敏感环境(9 月涨价 + token 膨胀后实际成本比 4.6 高 20–35%)建议评估 GLM-5.2、MiniMax-M3 等国产替代;中文场景 token 膨胀仅 1.01×,受涨价冲击小于英文用户。

榜单与实测落差

典型「跑分高但账单贵」:官方跑分接近 Opus 4.8(SWE-bench Pro 只差 6 分、GDPval-AA 反超 3 Elo),AA 实测单任务成本 $2.29 却约为 4.6 的两倍、比 Opus 4.8 贵约 15%(标准价口径),跑完整基准测试费用比 Fable 5 还贵;硬核逻辑题库(CritPt 17% vs GLM-5.2)被国产反超且贵约 6 倍。根因是新 tokenizer 膨胀(英文 1.42×)叠加高 effort 过度思考(max effort 输出 token 比 4.6 多约 40%、turns 多 6 倍);缓解:日常用 low/medium effort,复杂任务先核算真实 token 成本再开 Max,或直接换 Opus 4.8 同价换更强。

数据来源

本页由仓库 content/models/claude-sonnet-5.md 初始化。后续修订通过公开审核队列发布。