跳转到内容

模型:Gemini 3.6 Flash

来自封神榜 Wiki
名称 Gemini 3.6 Flash
厂商 Google DeepMind
发布日期 2026-07-21
上下文 1M
最大输出
价格 $1.5/$7.5
定位 速度封神

gemini-3-6-flashgemini78速度、前端、性价比

模型content/models/gemini-3-6-flash.md

一句话点评

速度断层领先却智力零进步:278 tps 碾压同级、输出再省 17%,幻觉与懒惰让高分沦为纸上谈兵。

社区反馈 · 编程

前端原型生成极快,React/Tailwind 组件秒级出稿,迭代速度是最大优势(550+ tps 帖、Linux.do 写码峰值 1141 tps);工具调用稳定——Terminal-Bench 2.1 78.0%(Terminus-2)超 3.1 Pro 的 73.8%,DeepSWE 49% 较 3.5 的 37% 大涨、每任务输出 token 从 276K 砍到 97K(-65%),MLE-Bench 63.9%(3.5 为 49.7%)。但复杂后端与算法实现不及 Opus 4.7/GPT-5.5,B站程序员阿江双 Agent 实测「Kimi K3/GLM-5.2/GPT-5.5/Opus 4.8 均一轮交付,3.6 补 5+4 轮仍未闭环」;Google AI 论坛楼主称「比 3.5 更弱,只适合简单问答」,OpenHands Index 亦指出 Gemini Flash 前端开发类别挣扎。

社区反馈 · 推理

GPQA Diamond 93.43%(Vals AI)较 3.5 的 92.68% 几乎零提升,AA Intelligence Index 冻结在 50(与 3.5 相同,落后 GPT-5.6 Luna 与 Muse Spark 1.1 的 51)——r/OpenAI「precisely 0% smarter」425 赞由此而来;社区体感「肤浅、犯明显错误」(SillyTavern 对比 3.1 Pro),MonkeyDrone(08-09)称「无视就在眼前的错误说一切正常,3.5 从不这样」;BenchLM Agentic 类 #68/132 是最弱类别,与 Terminal-Bench 78% 高分口径矛盾;Vals AI 点明 GPQA 已趋饱和不反映推理深度。

社区反馈 · 中文

基础能力获认可——「可以进行流畅的中文对话、写作、分析和多模态理解」,知乎称响应速度明显快于传统旗舰、中文长内容输出体验好;但 3.6 中文选词被 AI星球实测拉胯:「上下文窗口」写成「情境视窗」、「推理」译成「推论」,X 用户 Balder 点名「中文选词离谱」;深度创意写作与 nuanced 表达反馈较少,V2EX/知乎讨论聚焦速度与成本而非中文质量。结论:日常中文使用够用,中文技术写作需人工校对。

升级共识

速度优先用户与高频 API 调用者值得升级——成本效率真实改善(输出省 17%、DeepSWE 任务 token -65%、缓存读 -90%),长上下文检索翻倍修复了 3.5 的最大短板;但追求推理精度、中文质量、前端视觉审美的用户反馈偏负面(AA 智能指数冻结、官方承认 UI styling 回退、B站实测「快但闭环交付差」)。社区共识:3.6 相对 3.5 是「小幅进步而非质变」,幻觉与懒惰未解决;3.5 Flash 仍被称为「Google 版 Sonnet,但定价远离前代 Flash」。

榜单与实测落差

典型「分数高、体感分化」:Terminal-Bench 2.1 78.0% / DeepSWE 49% 官方高分 vs BenchLM Agentic #68/132 最弱类别——agentic 能力口径矛盾;Cursor 社区「前端全场最快」口碑 vs OpenHands Index「Gemini Flash 前端类别挣扎」+ 官方迁移指南「UI styling 评审偏好旧模型」——前端强项只在「功能代码」维度成立,视觉审美会回退;GPQA 93.43% 高分 vs 体感「肤浅、犯明显错误」,AA Intelligence Index 冻结 50 说明分数高不反映推理深度;AA 测速 280 tps 惊艳但 B站实测补 5+4 轮未闭环——「快」加速的是迭代,不是交付。

数据来源

本页由仓库 content/models/gemini-3-6-flash.md 初始化。后续修订通过公开审核队列发布。