跳转到内容

模型:GPT-5.5

来自封神榜 Wiki
名称 GPT-5.5
厂商 OpenAI
发布日期 2026-04-23
上下文 1M
最大输出 128000
价格 $5/$30
定位 薛定谔的旗舰

gpt-5-5gpt88.7长文、代码审查、科学分析

模型content/models/gpt-5-5.md

一句话点评

发布期登顶第一档的 1M 上下文旗舰,却因 516 截断与静默降级沦为 2026 Q2 最大争议——分数顶天,体感崩坏。

社区反馈 · 编程

两极分化且 harness 依赖严重:SWE-bench 88.7% 领跑、CodeRabbit 精确度 27.9%→40.6%,单文件/Bug 修复「感觉良好」(V2EX);但 OPQA(OpenAI 内部 20 个真实工程瓶颈)通过率仅 1.7%,而 5.2 Codex 曾达 8.33%——真实调试能力逐代退步(Gregory Terzian 04-25,Medium)。516 截断让 xhigh 复杂编程降智,5 月截断率飙至 53%(issue #30364)。跨 harness 落差巨大:同一 GPT-5.5 在 Cursor SDK 功能正确率 87.2%、原生 Codex 仅 61.5%(Endor Labs 04-27);掘金 VP 关嘉伟实测「Claude Code 一 compact 半张脸都没了」后转投 Codex 5.5(05-08)。

社区反馈 · 推理

简单/标准推理仍强:MMLU 92.4%、FrontierMath Tier 1-3 51.7%、ARC-AGI-2 85.0%(ARC Prize 官方验证 SOTA);但需深度推理的任务被 516 截断后骤降——HN 用户 nsingh2 复现同一逻辑题 516 token 必错、6000-8000 token 答对;推理 token 均值从 2 月 268 降至 5 月 107(-60%),社区共识为 serving-side batching bug 而非模型变笨。系统卡里被埋的 OPQA 显示:模型擅长写大段 bash 脚本、却对「诊断隐蔽性能回退」类真实工程问题越来越弱(5.5 的 1.7% vs 5.2 Codex 8.33%)。

社区反馈 · 中文

负面偏多:知乎「怎么在我这跟弱智一样」获大量共鸣,V2EX w568w「听不懂人话」137 回复,并给出实测排名「Opus 4.8 ≈ Opus 4.6 >> Opus 4.7 > GPT 5.5 ≈ MiMo 2.5 Pro >> GPT 5.2~5.4」(06-04);neteroster 则称「5.5 是执行的神,opus 是规划的神」。正面代表为「24 小时不睡觉的超级实习生」评测(知乎)与「写东西终于没那么 AI 味」(纳米网/钛媒体);中文创作未见明显退步,问题集中在指令遵循、长会话漂移与静默降级后的体感波动(V2EX 07-24 反映 5.6 上线后 Pro 被切到 5.5-mini)。

升级共识

短任务(单文件修复、代码审查、科学分析)可升级;长程/事实密集型任务建议保留 GPT-5.4 或转其他模型;xhigh 在 516 修复前慎用,改用 high/medium。多数开发者倾向「等 5.6」,但 07-19 出现 Save GPT-5.5 挽留站——5.6 上线后部分用户反而怀念 5.5 的执行能力,社区呈「等 5.6 修好 / 回 5.5」两派。

榜单与实测落差

「分数高、体感差」的集大成案例:SWE-bench 88.7% 登顶、ARC-AGI-2 85.0% SOTA,但 OPQA 真实调试仅 1.7%(逐代退步)、SWE-Bench Pro 仅 +1%、AA-Omniscience 幻觉率 86%。根因不止 516:同一模型在 Cursor SDK 功能正确率 87.2%、原生 Codex 仅 61.5%(Endor Labs,harness 差 26 点);官方 1M 上下文在 Codex 内实为 400K(社区实测约 258K),用户实际跑的模型/环境与 benchmark 测试并非同一套。缓解:high/medium 档 + 修改系统提示词 + 用 harness 优化层(Cursor > Codex CLI)。

数据来源

本页由仓库 content/models/gpt-5-5.md 初始化。后续修订通过公开审核队列发布。