跳转到内容

模型:Gemini 3.1 Pro

来自封神榜 Wiki
名称 Gemini 3.1 Pro
厂商 Google DeepMind
发布日期 2026-02-19
上下文 1M
最大输出 65000
价格 $2/$12
定位 推理翻倍新王

gemini-3-1-progemini80.6推理、前端生成、超长上下文

模型content/models/gemini-3-1-pro.md

一句话点评

推理翻倍登顶行业最难基准,前端 SVG 制霸;但静默更新与配额把口碑拖进「等下版」——能力封神,harness 拉胯。

社区反馈 · 编程

官方口径强势:SWE-bench Verified 80.6%(约等于 Opus 4.6 的 80.8%)、Terminal-Bench 2.0 68.5%、MCP Atlas 69.2%(较 3 Pro 54.1% 高 15pt)、BrowseComp 85.9%(3 Pro 59.2%);但 LayerLens 14,549 条独立测试中 SWE Bench Lite 仅 48.7%、BIRD-CRITIC 仅 32.5%,dev.to 四场景实测 3.1 Pro 0 次第一、3 次垫底("modern surface, broken fundamentals"——忽略 strconv.Atoi 错误、map 随机序、PUT 当 PATCH 用);OpenHands Index 五项均分 60.56,中游。r/singularity 173 赞帖直问「How is Gemini 3.1 at the top of SWE-bench?」。实测能一次生成完整 SVG 应用与操作系统级项目,但需多次抽卡(官方演示视频下有人吐槽 4 次才成功);302.AI 中文实测称其为「不知疲倦的代码推土机」。

社区反馈 · 推理

本版最大卖点:ARC-AGI-2 从约 31.1% 跃升至 77.1%(ARC Prize 已验证,非仅官方口径),GPQA Diamond 94.3% 为该基准纪录最高分;VentureBeat 称 high thinking 档相当于「Deep Think 的 mini 版」,MCP Atlas/BrowseComp 等 agentic 基准同步大涨(各 +15pt/+26.7pt);Sundar Pichai 在 X 上亲自宣传「core reasoning more than 2x 3 Pro」,HN 963 分帖围绕推理进步展开。反面:论坛实测发现 thinking 输出里出现「now that I've slept on it」(无状态系统的幻觉证据);high 档 TTFT 约 28-35s(Artificial Analysis),首日发布延迟 >100s(容量);Akhil Agrawal 评价「Best Reasoner in AI. That's Not the Same Thing as the Best Model」。

社区反馈 · 中文

中文社区情绪偏正面:量子位/36氪以「新王登场」「掀翻 Claude 4.6 强势登顶」密集报道,302.AI 实测 37.30 加权总分登顶自家多模态榜,SegmentFault/掘金中文专项实测称「可能是目前综合中文能力最均衡的海外大模型」(长文结构感强、8 轮以上多轮对话保持信息一致、50 万字文档处理延迟减半);负面集中在「需要多次抽卡」、多模态视觉单项退步(9.00→8.50)与「扎实但木讷的直男思维」(缺 Claude 4.6 的发散人情味);国内使用需第三方中转或免费方案。

升级共识

推理与前端能力确为实质升级:ARC-AGI-2 翻倍(31.1%→77.1%,ARC Prize 已验证)、MCP Atlas +15pt、BrowseComp +26.7pt,评测圈与媒体共识「值得升」,VentureBeat 甚至给出「Deep Think Mini」的定位;但 harness 体验拖后腿——Antigravity 论坛实测 TTFT 35s、静默降级、安全过滤器概率性拦截,Cursor 论坛证明需强制工具调用提示词才能用,Reddit 实际用户中「等下版」声音不小。纯推理/前端/vibe coding 场景可升,重 Agent 工作流与生产环境建议观望;独立开发者 3 个月实测(Gemini Lab)给出「40% Gemini / 60% Claude」的分流方案。

榜单与实测落差

基准全面登顶(12 项对比全第一、ARC-AGI-2 翻倍、MCP Atlas/BrowseComp 大涨),多平台用户却大量反映落差:HN 前 Googler(spankalee)高赞称「stunningly good at reasoning... but it just falls over a lot when actually trying to get things done」;LayerLens 14,549 条独立测试 SWE Bench Lite 仅 48.7%、BIRD-CRITIC 仅 32.5%,远低于官方 SWE-bench Verified 80.6%;OpenHands Index 五项均分 60.56(中游,低于 Opus 4.7 的 69.66);dev.to 四场景实测 0 次第一;Andon Café 展示真实运营中的判断缺失($38k 烧钱 vs $9k 销售)。根因是 harness 实现差、工具调用不可靠、静默更新与配额限制;缓解:API 直连并控制 thinking 档位,避开重 Agent 场景,或接受「40% Gemini / 60% Claude」分流。

数据来源

本页由仓库 content/models/gemini-3-1-pro.md 初始化。后续修订通过公开审核队列发布。