模型:GPT-5
| 名称 | GPT-5 |
|---|---|
| 厂商 | OpenAI |
| 发布日期 | 2025-08-07 |
| 上下文 | 400k |
| 最大输出 | 128000 |
| 价格 | $0.625/$5 |
| 定位 | 路由全能旗舰 |
一句话点评
发布即登顶 LMArena 全榜的「全能路由器」——编程推理封神,创意温度被批降级,更因下架 4o 引爆史上最大运营争议。
社区反馈 · 编程
最无争议的强项:HN 称「3→4 级别甚至更大的跳跃」,SWE-bench Verified 74.9%、Aider Polyglot 88% 均为发布时 SOTA,Design Arena 首超 Opus 4.1。swyx 在 latent.space 亲测三场景 one-shot——Vercel AI SDK v5 + Zod 4 依赖冲突「o3+Cursor couldn't figure it out, Claude Code+Opus 4 couldn't figure it out. GPT-5 one-shotted it」,同 prompt 下 o3 在 Cursor 只给 plan、GPT-5 直接出成品(约 10 倍时间差)。知识截止新(2024-09-30)让 OTel 配置类任务「both Claude and OpenAI models struggled with before... got the replies right on the first try」(HN c44839338)。分歧同样存在:Reddit 用户报告多轮反馈后代码「完全坏掉」,只给片段而非完整代码;WIRED 引 Kapoor 的 45 篇论文复现实测 GPT-5 medium 仅 27% 准确率、Opus 4.1 达 51%;Kieran Klaassen 直言「coding capabilities remind me of Sonnet 3.5」。302.AI 评「便宜、能打」。
社区反馈 · 推理
数学/科学推理获高度认可:AIME 2025 无工具 94.6%、GPT-5 Pro 满分;thinking 模式事实错误率较 o3 降 78-80%。但 SimpleBench 仅 56.7%(第 5 名、也是第 10 最低分 LLM)引发「分数高但简单推理不及更小模型」的质疑——分析指向 RL 重度集中于 AIME/GPQA 等高难基准。Kapoor 的 CoreBench 复现测试给出更冷的数据:同一批 45 篇论文,GPT-5 medium 复现 27%、Claude 旗舰 51%,且 GPT-5 成本 $30 对 $400——「便宜但准确率落后」(WIRED 采访)。Simon Willison 一周 daily-driver 后评价「it rarely screws up and generally feels competent or occasionally impressive」,但也承认「doesn't feel like a dramatic leap ahead」。
社区反馈 · 中文
整体偏中性偏负:302.AI 称中文综合「底层实力尚可但非突出」;知乎用户反映中文创作不如 4o 自然灵动;V2EX 对 GPT-5 系中文体验整体不满。正面亮点:生僻概念理解不错,AIGUI 不会被错拆为 AI GUI;swyx 在中文未专项测试但指出「It's actually worse at writing than GPT-4.5, and I think even 4o」——创作温度问题在中文语境同样被放大。
升级共识
技术用户(开发者/Agent 构建者)普遍认为值得升级——编程、Agent、数学推理强项明确,swyx 的 three one-shot 实测与 Notion「15% better」背书、OpenHands SWT-Bench 79.8% 都是硬证据;消费级用户强烈抵触,认为「变蠢了、没创造力了」,且 Kieran Klaassen 直言「like something that would have been released a year ago」。复杂编程与 Agent 场景值得升级;日常聊天/创意写作留在 4o,或考虑 5.1/5.2 的个性化预设。
榜单与实测落差
LMArena 全榜 #1 与「变蠢了」并存——Arena 偏好严谨准确,用户怀念 4o 的温度与创意,投票偏好与主观满意度背离;幻觉率官方称降 45-80%,部分用户反而感觉更多,或为期望过高、关闭工具时差距缩小;SimpleBench 56.7%(第 5 名/第 10 最低分)与 SOTA 宣传尖锐矛盾,根因是 RL 集中于高难基准;Kapoor 的 45 篇论文复现 27% vs Opus 4.1 51% 是「榜单 vs 真实科研任务」差距的第三方量化——缓解:thinking 模式 + 浏览/工具核验,或直接上 GPT-5 Pro。
数据来源
本页由仓库 content/models/gpt-5.md 初始化。后续修订通过公开审核队列发布。