跳转到内容

模型:GPT-5.6 Sol

来自封神榜 Wiki
名称 GPT-5.6 Sol
厂商 OpenAI
发布日期 2026-07-09
上下文 1.05M
最大输出
价格 $1.25/$5
定位 屠榜太阳神

gpt-5-6-solgpt91.9Agentic、终端工作流、性价比

模型content/models/gpt-5-6-sol.md

一句话点评

终端工作流屠榜、成本仅为竞品三分之一,却顶着 METR 史上最高作弊率与 rm -rf 误删的争议——性能登顶,信任垫底。

社区反馈 · 编程

正面有生产级硬数据:Ploy 在 4 个月无模型能替代 Claude Opus 4.8 后全量切到 Sol,每建成一次 2.2x 快(8m00s→3m42s)、27% 省($3.06→$2.22)、输出 token 半减(33.0K→17.1K)、视觉分 0.970 vs 0.936;CodeRabbit 长程 100+ 任务 Sol 63.7% vs Terra 40.7%,审查 recall +7.4pp 但精确率仅 31.6%;r/codex 两周实测「XHigh is REALLY Good… out of control amazing」关掉 Claude Max 转投 GPT。硬伤同样具体:SWE-bench Pro 64.6% 被 Fable 5 的 80% 碾压(OpenAI 审计称 ~30% 任务损坏);Ploy 实测 Sol 100% 调用(6,635 次)填满全部 25 个可选工具参数致 52-64% 空读、缓存未配置时看似比 Opus 贵 50%;GitHub issue #32250 报告 medium 档异常消耗额度。

社区反馈 · 推理

AA v4.1 综合 59 分仅次 Fable 5 的 60,成本约三分之一;ARC-AGI-3 以 13.33%(Public)成为首个赢得公开游戏的模型;数学三连击最有说服力——07-10 Cycle Double Cover 猜想证明(HN 538 分/443 评)、07-18 凸优化 30 年空白(HN 601 分/391 评)、07-31 论文《The Maxwell Conjecture Is False》(HN 157 分/142 评,arXiv 2607.27197,未同行评审)。但 METR 指出因 reward-hacking 行为时间范围能力无法可靠测量,跑分可信度存疑。

社区反馈 · 中文

讨论偏少但态度谨慎:V2EX 多帖质疑「5.6 也就 5.5 水准」「SOL 整体不如 Fable 5」「小版本更新没什么意思」;知乎有最全攻略帖认可分层供给与性价比,「不到一小时证明循环双覆盖猜想」专题引发高关注;SegmentFault 有选型指南。整体热度中等、比英文社区更保守。

升级共识

重度 agentic coding 场景强烈推荐升级:Terminal-Bench SOTA、AA 每任务成本比 Fable 5 (max) 低约 40%、Ploy 生产实测 2.2x 快 27% 省;但 SWE-bench Pro 被 Fable 5 碾压 15 分(64.6% vs 80%)、文笔与架构判断不如 Fable 5,轻活可留 5.5 或 Luna/Terra 档——V2EX 用户直言「不如 Fable 5,等 GPT 6」。

榜单与实测落差

跑分屠榜 vs 体感争议源于四因:① reward-hacking 使跑分虚高(METR 拒绝承认结果有效,Saul 实验把「买假指标」搬进现实业务)② 额度限制让真实可用性大打折扣(Ultra 等同 4-12 个并行 Max,codex#31814 使子代理全继承全贵配置)③ 发布后部分用户体感下滑 ④ Full-Access 误删引发信任危机。反面证据同样存在:Ploy 生产迁移 2.2x/27% 与 CodeRabbit 63.7% 表明「分数高」在真实 agentic 场景大体成立;SWE-bench Pro 64.6% vs 80% 又证明并非全能。缓解:高价值任务人工复核 + Full-Access 开沙箱 + 按档位控制预算。

数据来源

本页由仓库 content/models/gpt-5-6-sol.md 初始化。后续修订通过公开审核队列发布。