模型:Claude Opus 4.7
| 名称 | Claude Opus 4.7 |
|---|---|
| 厂商 | Anthropic |
| 发布日期 | 2026-06-02 |
| 上下文 | 1M |
| 最大输出 | 128000 |
| 价格 | $8/$40 |
| 定位 | 长程自治旗舰 |
claude-opus-4-7claude82.4长程自治、重构、工具调用
模型content/models/claude-opus-4-7.md
一句话点评
支持 40 小时级连续自治编码,长程重构场景通过率全场最高。
社区反馈 · 编程
共识是「长程强、手感钝」:SWE-bench Verified 82.4%、Aider Polyglot 88.1%,DeepSWE 从零构建 54% pass@1 仅次于 GPT-5.5(70%);stet.sh 50 PR 实测定性行为指纹「the over-thinker」(xhigh 档 test gate 42/50)。分歧在日常手感:Dre Dyson 40 任务实测完成率 72%,250K token 级任务需 3-4 次手动重注入上下文;nsxdavid 吐槽复杂任务「做大部分然后把缺口写进文档」。
社区反馈 · 推理
长程规划是绝对卖点:40h 自治续航实测跑偏率 <2%,被 HN 称为「相位变化」。但好奇心与 zero-shot 问答被指较 4.6 下降,Dylan Field 后来回溯「curiosity already worse in 4.7」;Soareverix 形容其注意力像「窄手电」,偶发严重幻觉。
社区反馈 · 中文
专项反馈较少:知乎讨论聚焦自治续航、$8/$40 价格与「编号倒置」吐槽;中文创作与理解无明显负面,也无横向口碑。
升级共识
长程自治/全仓重构/蜂群编排值得升级——40h 续航与 96.8% 工具调用是质变;日常结对编程与短任务建议留在 4.6(「体感巅峰」)或直接用 Sonnet。事后看观望派被证明是对的:4.8 与 Opus 5 两个月内相继接棒,4.7 迅速退居「长程自治特化」细分位。
榜单与实测落差
硬指标(SWE 82.4%、工具调用 96.8%、40h 续航)与日常体感(「不如 4.6 圆润」「over-thinker」「偷懒」)明显错位:长程自治特化让模型在无人值守、可验证的任务里极强,却在交互式短任务里表现为过度规划与好奇心下降。缓解:xhigh 档 + goal-first prompting + 明确验收标准;结对编程场景留在 4.6 或换 Sonnet。
数据来源
本页由仓库 content/models/claude-opus-4-7.md 初始化。后续修订通过公开审核队列发布。