跳转到内容

模型:Gemini 3 Pro

来自封神榜 Wiki
名称 Gemini 3 Pro
厂商 Google DeepMind
发布日期 2026-04-28
上下文 2M
最大输出 64000
价格 $4/$18
定位 超长上下文旗舰

gemini-3-progemini78.9超长文、前端、多模态

模型content/models/gemini-3-pro.md

一句话点评

2M 上下文可整仓吞吐,前端与多模态任务表现突出。

社区反馈 · 编程

首轮一遍过能力显著强于 GPT-5,除 golang 外无语法/运行时错误(知乎实测);前端(React 应用、物理模拟、网页游戏)尤受好评,CSDN 称编程能力提升 20%+,WebDev Arena 1487 Elo 登顶。Kilo Code 独立测试 5 个硬核任务 Gemini 3 Pro 72% > Claude 4.5 Sonnet 54% > GPT-5.1 Codex 18%(X @kilocode)。但强度分化明显:302.AI 实测前端/UI「成品缔造专家」,算法理论编程(递归优化/动态规划/图论)却「推导深度不足、辅助角色局限」;后续更新「变懒」争议——用户称「像打地鼠一样修一个 bug 引入三个新 bug」(r/GoogleGeminiAI 1peddtu),虎嗅实测「BUG 越修越多」「嘎巴一下死给你看」(huxiu 4809805)。Composio 同仓实测:Test1 生产 feature 构建 $0.45/7min14s 三家中最佳,Test2 长程 agent 却陷入 loop 烧掉 $6.3 无产出(composio.dev 2025-12-28)。

社区反馈 · 推理

ARC-AGI-2 31.1%(Deep Think 45.1%)较 2.5 Pro 近 6 倍跃升,GPQA Diamond 91.9% 达 SOTA,MathArena Apex 23.4% 是 GPT-5.1 的 20 倍以上;Dan Hendrycks 称「Gemini 3 is the largest leap in a long time」(X 1991188101633278145)。但 AA-Omniscience 暴露「高智商高自负」:知识检索准确率 55.9%,未知问题幻觉率却高达 88%(Claude Haiku 仅 26%),指数 +13 虽为首个大幅转正模型,幻觉却是最差梯队(Zvi:the most likely to give the right answer, but it'll be damned before it answers "I don't know")。Deep Think 长文件 RAG 亦不如预期——整文件塞入上下文而非精准检索(Reddit r/ChatGPTPro)。

社区反馈 · 中文

知乎/CSDN 认为中文理解良好,长文评测与教程产出量大,中文创作无明显短板;但中文场景幻觉同样存在,知乎称「幻觉比 GPT-5.1 严重得多,一逗就出来」。中文实测最惊艳的是前端:腾讯云 238 天等待后「2025 年最牛逼的模型」,单 prompt 生成仿 Windows Web OS、黑胶音乐播放器(唱臂随播放移动)、体素奶龙场景,「能让 AI 帮你操作电脑干活的 Agent,Gemini 3 Pro 就是唯一的真神」(cloud.tencent.com 2595716);虎嗅让 0 代码文科生 81 秒做出牛马时钟、92 秒做出照片处理工具、124 秒做出 24 点计分器,「人人真的都可以是产品经理了」。太平洋科技补充:50 模块遗留库找内存泄漏「其他模型第 10 个文件就遗忘前文,它精准定位三个隐蔽的循环引用错误」,但中文互联网语境偶显「学院派」需人工微调(pconline 1547539)。

升级共识

编程(尤其前端 vibe coding)、多模态与 Agent 场景值得升级——Kilo Code 独立测试 72% 碾压同场 Claude 4.5 Sonnet(54%)与 GPT-5.1 Codex(18%),Karpathy 与 Matt Shumer 双双把 3 Pro 定为 daily driver,Demis 本人「late night vibe coding」乐在其中。但幻觉敏感(未知问题 88% 自信幻觉)、要求指令精准(虎嗅实测 BUG 越修越多)、或做长程 agent(Composio Test2 烧 $6.3 无产出)的用户建议观望:Claude Opus 4.5/5 或 GPT-5.1 更稳,或等 Gemini 3.1 Pro 校准版(幻觉率 88%→50%)。价格上 3 Pro 输入较 2.5 Pro 贵 60%(>200k 档翻倍到 $4),预算敏感者建议 Gemini 3 Flash(OpenHands Index 实测 SWE-bench 74.6% 反超 3 Pro 的 70.6%)。

榜单与实测落差

榜单全面 SOTA 登顶(LMArena 1501 首破 1500,领先 Grok 4.1 达 17 分;ARC-AGI-2 近 6 倍跃升),实测却被「高智商高自负」拖累:AA-Omniscience 知识准确率 55.9% 而未知问题幻觉率 88%(Claude Haiku 仅 26%),Zvi 毒舌总结「vast intelligence with no spine」。根因是过度自信而非能力不足:前端/多模态/数学实测碾压(Kilo Code 72%、腾讯云「唯一真神」、302.AI「UI 构建的神」),但算法理论编程(302.AI「推导深度不足」)、DeepThink 长文件 RAG、以及后续更新「变懒」构成另一条落差线;OpenHands Index 实测 SWE-bench 70.6% 落后 GPT-5.2(74.6%),官方亦承认「did not quite rise to the level of Anthropic or OpenAI」。直至 3.1 Pro 校准才把幻觉率降至 50%。

数据来源

本页由仓库 content/models/gemini-3-pro.md 初始化。后续修订通过公开审核队列发布。