跳转到内容

模型:Claude Opus 4.7

来自封神榜 Wiki
名称 Claude Opus 4.7
厂商 Anthropic
发布日期 2026-06-02
上下文 1M
最大输出 128000
价格 $8/$40
定位 长程自治旗舰

claude-opus-4-7claude82.4长程自治、重构、工具调用

模型content/models/claude-opus-4-7.md

一句话点评

支持 40 小时级连续自治编码,长程重构场景通过率全场最高。

社区反馈 · 编程

共识是「长程强、手感钝」:SWE-bench Verified 82.4%、Aider Polyglot 88.1%,DeepSWE 从零构建 54% pass@1 仅次于 GPT-5.5(70%);stet.sh 50 PR 实测定性行为指纹「the over-thinker」(xhigh 档 test gate 42/50)。分歧在日常手感:Dre Dyson 40 任务实测完成率 72%,250K token 级任务需 3-4 次手动重注入上下文;nsxdavid 吐槽复杂任务「做大部分然后把缺口写进文档」。

社区反馈 · 推理

长程规划是绝对卖点:40h 自治续航实测跑偏率 <2%,被 HN 称为「相位变化」。但好奇心与 zero-shot 问答被指较 4.6 下降,Dylan Field 后来回溯「curiosity already worse in 4.7」;Soareverix 形容其注意力像「窄手电」,偶发严重幻觉。

社区反馈 · 中文

专项反馈较少:知乎讨论聚焦自治续航、$8/$40 价格与「编号倒置」吐槽;中文创作与理解无明显负面,也无横向口碑。

升级共识

长程自治/全仓重构/蜂群编排值得升级——40h 续航与 96.8% 工具调用是质变;日常结对编程与短任务建议留在 4.6(「体感巅峰」)或直接用 Sonnet。事后看观望派被证明是对的:4.8 与 Opus 5 两个月内相继接棒,4.7 迅速退居「长程自治特化」细分位。

榜单与实测落差

硬指标(SWE 82.4%、工具调用 96.8%、40h 续航)与日常体感(「不如 4.6 圆润」「over-thinker」「偷懒」)明显错位:长程自治特化让模型在无人值守、可验证的任务里极强,却在交互式短任务里表现为过度规划与好奇心下降。缓解:xhigh 档 + goal-first prompting + 明确验收标准;结对编程场景留在 4.6 或换 Sonnet。

数据来源

本页由仓库 content/models/claude-opus-4-7.md 初始化。后续修订通过公开审核队列发布。