模型:Claude Haiku 4.5
| 名称 | Claude Haiku 4.5 |
|---|---|
| 厂商 | Anthropic |
| 发布日期 | 2026-06-20 |
| 上下文 | 200k |
| 最大输出 | 64000 |
| 价格 | $1/$5 |
| 定位 | 轻量并行单元 |
claude-haiku-4-5claude63.4速度、轻量、蜂群
模型content/models/claude-haiku-4-5.md
一句话点评
轻量快速,适合作为并行执行的子任务单元。
社区反馈 · 编程
最大卖点:SWE-bench Verified 73.3% 追平五个月前登顶的 Sonnet 4(72.7%),Terminal-Bench 41.0% 为 Claude 系第二(仅次于 Sonnet 4.5 的 50.0%);r/ClaudeCode 实测「surprisingly good at writing code (if there is a plan)」——有明确计划时又快又准。但无思考模式掉到 63.4%,深度重构仍需 Sonnet/Opus 兜底;302.AI 掘金实测「输出内容相对冗长」,复杂调试不是它的强项。
社区反馈 · 推理
「首款支持扩展思考的 Haiku」:GPQA Diamond、MMMLU、MMMU 均稍逊 Sonnet 4(新智元数据),但 AIME 2025 无工具准确率反超 Sonnet 4 高 10%+;OSWorld 50.7% vs Sonnet 4 42.2% 证明 agentic/computer use 推理反超旗舰。社区共识:简单到中等任务 Haiku 的思考够用,硬推理别指望小模型。
社区反馈 · 中文
中文专项评测较少:知乎仅新智元一个高权重问题(10.7k 浏览),V2EX 实测「用了下还不错」、Linux.do 称「更快、更便宜、也更聪明」;多语言能力被官方列为亮点(SWE-bench Multilingual 接近旗舰档)。无明显负面,中文创作/审美反馈基本缺位。
升级共识
从 Haiku 3.5 升级值得:SWE 63.4%→73.3%(思考档)、最大输出 8K→64K、新增 extended thinking 与 computer use,价格仅上调 25% 却换来近旗舰编程能力——「1/3 成本追平 Sonnet 4」是 2025-2026 最硬的性价比叙事。日常子代理/快速原型/配额省流场景立即升级;复杂调试与深度推理场景留在 Sonnet/Opus。12 个月无更新的现实提醒:等下一个 Haiku 的用户可观望,但不影响当前值的判断。
榜单与实测落差
「分数与体感基本一致,唯一落差在思考依赖」:SWE 73.3%(128K 思考)看着很强,无思考档掉到 63.4%——榜单测的是开思考的分数,日常 Harness 若默认关思考会明显变笨;302.AI 实测「输出相对冗长」是第二处落差。反过来 OSWorld 50.7% 反超 Sonnet 4 与 AIME 无工具高 10% 两项「反直觉超旗舰」社区复现良好。缓解:Claude Code 保持 thinking 开启 + 有明确 plan 再交给 Haiku。
数据来源
本页由仓库 content/models/claude-haiku-4-5.md 初始化。后续修订通过公开审核队列发布。