跳转到内容

模型:Claude Haiku 4.5

来自封神榜 Wiki
名称 Claude Haiku 4.5
厂商 Anthropic
发布日期 2026-06-20
上下文 200k
最大输出 64000
价格 $1/$5
定位 轻量并行单元

claude-haiku-4-5claude63.4速度、轻量、蜂群

模型content/models/claude-haiku-4-5.md

一句话点评

轻量快速,适合作为并行执行的子任务单元。

社区反馈 · 编程

最大卖点:SWE-bench Verified 73.3% 追平五个月前登顶的 Sonnet 4(72.7%),Terminal-Bench 41.0% 为 Claude 系第二(仅次于 Sonnet 4.5 的 50.0%);r/ClaudeCode 实测「surprisingly good at writing code (if there is a plan)」——有明确计划时又快又准。但无思考模式掉到 63.4%,深度重构仍需 Sonnet/Opus 兜底;302.AI 掘金实测「输出内容相对冗长」,复杂调试不是它的强项。

社区反馈 · 推理

「首款支持扩展思考的 Haiku」:GPQA Diamond、MMMLU、MMMU 均稍逊 Sonnet 4(新智元数据),但 AIME 2025 无工具准确率反超 Sonnet 4 高 10%+;OSWorld 50.7% vs Sonnet 4 42.2% 证明 agentic/computer use 推理反超旗舰。社区共识:简单到中等任务 Haiku 的思考够用,硬推理别指望小模型。

社区反馈 · 中文

中文专项评测较少:知乎仅新智元一个高权重问题(10.7k 浏览),V2EX 实测「用了下还不错」、Linux.do 称「更快、更便宜、也更聪明」;多语言能力被官方列为亮点(SWE-bench Multilingual 接近旗舰档)。无明显负面,中文创作/审美反馈基本缺位。

升级共识

从 Haiku 3.5 升级值得:SWE 63.4%→73.3%(思考档)、最大输出 8K→64K、新增 extended thinking 与 computer use,价格仅上调 25% 却换来近旗舰编程能力——「1/3 成本追平 Sonnet 4」是 2025-2026 最硬的性价比叙事。日常子代理/快速原型/配额省流场景立即升级;复杂调试与深度推理场景留在 Sonnet/Opus。12 个月无更新的现实提醒:等下一个 Haiku 的用户可观望,但不影响当前值的判断。

榜单与实测落差

「分数与体感基本一致,唯一落差在思考依赖」:SWE 73.3%(128K 思考)看着很强,无思考档掉到 63.4%——榜单测的是开思考的分数,日常 Harness 若默认关思考会明显变笨;302.AI 实测「输出相对冗长」是第二处落差。反过来 OSWorld 50.7% 反超 Sonnet 4 与 AIME 无工具高 10% 两项「反直觉超旗舰」社区复现良好。缓解:Claude Code 保持 thinking 开启 + 有明确 plan 再交给 Haiku。

数据来源

本页由仓库 content/models/claude-haiku-4-5.md 初始化。后续修订通过公开审核队列发布。