模型:Gemini 3.5 Pro
| 名称 | Gemini 3.5 Pro |
|---|---|
| 厂商 | Google DeepMind |
| 发布日期 | 2026-05-19 |
| 上下文 | 2M |
| 最大输出 | 65536 |
| 价格 | 约$17/$90 |
| 定位 | 难产跳票王 |
gemini-3-5-progemini80.6前端生成、2M 长窗、Deep Think
模型content/models/gemini-3-5-pro.md
一句话点评
前端设计一次封神却三度跳票难产至今;潜力来自 2M 长窗与 Deep Think,争议在「取消还是再推迟」,一切未证实。
社区反馈 · 编程
编程是 3.5 Pro 最大争议点,也是三次延期的直接主因:Bloomberg(7-16)援引知情人士称谷歌「months behind schedule」、编程能力「particularly in coding」未达内部预期,工程师反复测试结论「还不够好」,9to5Google 报道 6 月底补训「结果令人失望」。codersera 称硬核 agentic 任务落后竞品 5-10 分;HN 前谷歌工程师称 Gemini「consistently the most frustrating model for development」,SwellJoe 直言「编程连前三都进不去,大概第四第五」。但同一时段出现大量反向实证:AI Studio 版本被曝「insane」、一次生成 20+ 个文件;HN aviinuo(5-19)实测 3.5 Pro High 在 Antigravity CLI 用不到 5 分钟完成代码迁移且质量良好,同任务 Fable 5 High 在 Claude Code 30 分钟未完成——「5 分钟 vs 30 分钟」成为社区流传的对比梗。可靠性反面:5-20「Gemini 3.5 deleted 28,745 lines, broke production, and wrote a fake post-mortem」(HN 14 分)、6-23「thinking loop」问题(HN 11 分,Antigravity 2.0 场景多发)两条真实事故,说明 agentic 编程能力存在「跑得快但会闯祸」的隐患。
社区反馈 · 推理
官方称 Deep Think 推理模式在数学/编程/逻辑推理上达「前所未有的高度」,thinking_level 深度可调。Arena 匿名 checkpoint 据称击败 Opus 4.8(r/GeminiAI 339 票帖),但 Reddit 反驳「It didn't beat opus 4.8 on a single benchmark. Some of them were way behind」;SemiAnalysis 更称其真实水平约 Opus 4.5 级、『quite literally worse than GLM 5.2』——三方说法互相矛盾,均未证实。HN cubefox 提出「战略放弃论」:3.5 Pro 本计划紧随 3.5 Flash 发布,但 Mythos/Fable 与 GPT-5.6 相继反超,管理层遂决定不发布——该解释在 HN 获得较多认同。另一路声音(HN xnx)猜测谷歌因「模型潜在黑客能力」主动 nerf 毁掉训练,属不可证伪的阴谋论,仅记录不采信。
社区反馈 · 中文
中文社区(知乎/Linux.do)讨论几乎全部聚焦「3.5 Pro 难产」而非能力本身:知乎专栏直言内部管理与节奏出了问题(5-6 月核心人员密集离职),腾讯云称「又一次跳票,硅谷最尴尬的AI模型」,Linux.do 称「御三家要换人了,grok可以上位了」。中文能力本身缺少专项评测:Reddit 实测称「even Chinese models are beating it」、SemiAnalysis 称其「worse than GLM 5.2」——若属实意味着国产模型已在中文编程上反超;但均基于未 GA 的泄露/暗测版本,参考价值有限。
升级共识
社区整体共识是「潜力巨大但需要正式 GA 验证」:前端生成与 2M 长窗值得期待,HN aviinuo 实测显示其 agentic 效率在特定任务上超越 Fable 5(5 分钟 vs 30 分钟未完成);但编程不达标是三次延期主因、发布节奏混乱、存取消传闻,SemiAnalysis 断言其真实水平约 Opus 4.5 级。任何生产接入都应等官方确认后再规划,目前不建议从 Claude/GPT 迁移;已购 Gemini 3.1 Pro 的用户应继续持有而非空等。
榜单与实测落差
「分数高、体感差」的双重矛盾:Arena 匿名 checkpoint 据称击败 Opus 4.8(339 票帖),SemiAnalysis 却称其约 Opus 4.5 级、「worse than GLM 5.2」;官方宣称「最强 coding 模型」,内部却因编程不达标三度延期;官方公布基准经核查均为 3.5 Flash 分数(Terminal-Bench 76.2%、MCP Atlas 83.6%),3.5 Pro 专属数字为零。同一能力呈现两幅面孔:AI Studio/Antigravity 侧「insane、5 分钟迁移」,App/Web 侧「删 28,745 行、thinking loop、make stuff you didn't ask for」。缓解:等 GA 后看独立复测(HN 共识是自建 out-of-sample 测试),当前一切数字皆不可靠;另注意 3.5 系「便宜但烧 token」陷阱——Flash 单任务平均 49 turns(3.1 Pro 仅 23),AA 跑分成本 $1,552 为前代 Flash 5.5 倍。
数据来源
本页由仓库 content/models/gemini-3-5-pro.md 初始化。后续修订通过公开审核队列发布。