跳转到内容

模型:GPT-5.2

来自封神榜 Wiki
名称 GPT-5.2
厂商 OpenAI
发布日期 2026-05-14
上下文 800k
最大输出 96000
价格 $5/$30
定位 全能旗舰

gpt-5-2gpt80.1全能、多模态、生态

模型content/models/gpt-5-2.md

一句话点评

能力面最宽的全能旗舰,多模态与工具生态完整,无明显短板。

社区反馈 · 编程

两极分化明显:基准端 SWE-bench Pro 55.6% SOTA、Verified 80.0%,InfoQ 实测「同价位无对手」;但真实工程落地口碑分裂——OpenHands Index 上 GPT-5.2 平均分 58.84、5.2-Codex 58.28,均落后总分第一的 Claude 4.5 Opus(60.58);B 站程序员阿江真实代码对决中 5.2「Thread 乱入 Asyncio、中间件写得像脚本」,工程化输给 Opus 4.5。反方数据也有:Devon Mack 盲评代码评审,gpt-5.2-high 抓到 3/3 真实 bug,Claude opus-high 只抓到 1/3;Augment Code 发布日即宣布 Code Review 默认选用 5.2(HN 12 分)。HN 顶部评论的共识是「对编码已经足够好」,不再求强而应求稳。

社区反馈 · 推理

数学与形式推理公认顶尖:AIME 2025 满分、GPQA Diamond 92.4%、FrontierScience-Olympiad 77%(发布时全场最高,Research 25%);2026-01-19 陶哲轩亲自验证 GPT-5.2 Pro 对埃尔德什 #281 的证明「没犯任何错误」,评价为「迄今为止最明确的第一类结果」,不过随后发现该题 1966 年 Rogers 定理即可解(属「45 年无人关注」),陶哲轩同时提醒 AI 在埃尔德什问题上真实成功率仅 1-2%。日常推理仍被吐槽「智商不稳定」:官方称幻觉率较 5.1 降 38%,用户依旧感知「降智」,Medium 评测直接定性「I tested GPT 5.2 and it's just bad」;HN 顶部评论认为最强模型已近极限,该改进的是 grounding 而非智能。

社区反馈 · 中文

中文社区反馈以负面为主:知乎出现「48 小时口碑血崩」「差评如潮」高热度讨论,澎湃定调「降智遭全网差评!奥特曼慌了」,界面新闻归因「期望错位+发布过早」。但也有客观派——量子位全程正面报道陶哲轩验证数论猜想(2026-01-19),InfoQ 实测认可「编程同价位无对手、深度推理封神」但点名「速度太拉胯」,华尔街见闻首发评测标题「很强,能执行复杂深度任务,但慢得抓狂」。核心痛点是语气生硬、说教化、交互体验差,而非中文理解力不足。

升级共识

技术评测圈与终端用户严重分裂:认可派(InfoQ、量子位、OpenHands 绿地分榜、Augment Code)认为专业知识工作、高难度数学与复杂编程(Thinking/Pro 档)确实值得升级——SWE-bench Pro 55.6% SOTA、Erdős #281 获陶哲轩验证、OpenHands 绿地开发曾登顶;反对派(Reddit 主力、澎湃、知乎)认为日常对话、创意写作与语气敏感场景「分数涨了但体感退了」,LMArena 滑落至 #15、Instant 档自认回归进一步强化观望情绪。多数日常用户建议留在 4o 或 5.1,深度任务用户可试 Thinking/Pro。

榜单与实测落差

典型「分数高、体感差」:AIME 满分、SWE-bench Pro SOTA、GDPval 超人类专家与「降智」体感并存。榜单侧反差有三处硬证据——LMArena Text 总榜滑落至约 #15(低于 5.1 与 Opus 4.5);SWEbench.com 官方榜 5.2 high 71.8% 落后 Opus 4.5 的 74.4% 与 Gemini 3 Pro 的 74.2%;OpenHands Index 平均分 58.84/58.28 落后 Opus 4.5 的 60.58(仅绿地开发分榜登顶)。根因是期望错位:OpenAI 主打专业知识工作与基准,用户关注日常流畅与创造性;Instant 档质量下滑(0.976→0.878)与过度审查(hall monitor/Grokipedia 引用)进一步放大反差。缓解:深度任务用 Thinking/Pro 档,日常交互切回 4o 或 5.1,前端审美类任务参考 DataLearner 建议换 Opus/Gemini。

数据来源

本页由仓库 content/models/gpt-5-2.md 初始化。后续修订通过公开审核队列发布。