跳转到内容

模型:Claude Sonnet 4.6

来自封神榜 Wiki
名称 Claude Sonnet 4.6
厂商 Anthropic
发布日期 2026-02-17
上下文 500k
最大输出 128000
价格 $3/$15
定位 均衡主力

claude-sonnet-4-6claude79.6均衡、蜂群、日常

模型content/models/claude-sonnet-4-6.md

一句话点评

速度与质量均衡,多实例并行时单位成本效率最高。

社区反馈 · 编程

发布即「均衡主力」:SWE-bench Verified 79.6%(10 次平均)距 Opus 4.6(80.8%)仅 1.2pt、碾压 GPT-5.2(~78%),Claude Code 实测 70% 偏好压过 4.5;中文社区共识是「会先读完上下文再改代码」「免费用户也能用 Opus 级编程能力」。但 3 月 9 日起出现量化质量回退:GitHub #46935 记录 50 个会话 1400+ 次「WTF 事件」、每周重复指令频率从 ~25 飙到 484(19x),用户被迫切回 Opus;4 月 8 日 elevated errors(HN 62 分/88 评论);6 月中旬「back to normal」后 medium effort 好评回归(362 分热帖「cant understand why people are using larger models at all」)。

社区反馈 · 推理

agentic 推理是最大亮点:GDPval-AA 1633 Elo 全场第一(反超 Opus 4.6 的 1606)、TerminalBench 53% 全场第一、ARC-AGI-2 60.4%(max effort)、Math 89%(较 4.5 的 62% +27 分);有 X 用户观察「从没见 4.6 思考超过几秒,结果却很好」(135 回复帖)。但深度科学推理是短板:GPQA Diamond 74.1% 落后 Opus 4.6(91.3%)17 分,知乎实测亦确认「深度逻辑推理仍存差距」;adaptive thinking 的 token 消耗不可控(HLE 单项烧 47M 输出 token)是「想得深」的代价。

社区反馈 · 中文

中文场景讨论聚焦性价比与编程(「免费用户 Opus 平替」成知乎/掘金主流叙事),创作与理解专项反馈较少且无明显负面;但「我是 DeepSeek」身份错乱是中文场景最大舆论点:中文问「你是什么模型」时自称「我是 DeepSeek」,恰逢 Anthropic 指控 DeepSeek 工业级蒸馏(24,000 账号/1,600 万次交换),stevibe 推文 1251 RT/349 回复、Redis 作者 antirez 亲自复现——中文身份稳定性存疑。

升级共识

从 Sonnet 4.5 升级 4.6 明确值得:SWE-bench 77.2%→79.6%、上下文 200K→1M(GA 后全窗口标准价)、GDPval-AA 登顶全场第一、同价 $3/$15、Claude Code 实测 70% 偏好。但两个前置条件:一、日常务必用 medium effort 控 token(AA 实测 max effort 成本约为 4.5 的 3 倍,「单任务不比 Opus 便宜多少」);二、若从 Opus 4.5 降级需接受 GPQA 类深度推理 17 分差距与 3-4 月曾出现的质量回退风险——6 月回归后 medium effort 体感「不比大模型差」(362 分热帖)。预算更敏感可评估 DeepSeek-V4/GLM-4.6 等国产替代。

榜单与实测落差

「分数高、体感稳中带刺」:SWE-bench 79.6% 逼近 Opus 4.6、GDPval-AA 1633 反超——但 AA 实测单任务真实成本约为 4.5 的 3 倍,「5 倍便宜」的营销口径被 token 消耗吃掉了大半;3-4 月量化回退又把体感打到低谷(GitHub #46935 的 WTF 频率 19x)。根因是 adaptive thinking 的推理预算不可控 + 服务端质量波动;缓解方案:日常 medium effort、关注 status page、复杂任务切 Opus 4.6。6 月回归后 medium effort 好评验证了「调对档位,4.6 就是那台均衡主力」。

数据来源

本页由仓库 content/models/claude-sonnet-4-6.md 初始化。后续修订通过公开审核队列发布。