模型:Gemini 3 Flash
| 名称 | Gemini 3 Flash |
|---|---|
| 厂商 | Google DeepMind |
| 发布日期 | 2025-12-17 |
| 上下文 | 1M |
| 最大输出 | 32000 |
| 价格 | $0.5/$3 |
| 定位 | 高速轻量 |
gemini-3-flashgemini78速度、杂务、多模态
模型content/models/gemini-3-flash.md
一句话点评
延迟最低的多模态模型,适合高频轻量任务。
社区反馈 · 编程
最大亮点:SWE-bench Verified 78% 官方自报,第三方 Medium 四模型横评独立复现 78.0%(Claude Opus 4.5 80.9%、GPT-5.2 80.0% 紧随)——反超自家 3 Pro 的 76%;知乎 302.AI 实测前端网页复刻「三组当中最还原」,玻璃拟态+视差细节发挥好,但圣诞沙盒编辑器「代码质量不如 3 Pro」;r/GithubCopilot「Gemini 3 Flash (Preview) is really impressive」称「慢慢取代我的 daily driver」;OpenAI 自家 ChatGPT 源码流出被扒出 FAST_MODEL="google/gemini-3-flash"(HN 评论 pranshuchittora 实证),是闭源巨头也选它当快路径的硬证据。
社区反馈 · 推理
博士级推理达标:GPQA Diamond 90.4%、HLE 33.7% 无工具(官方),AIME 2025 95.2%;但知乎 302.AI 逻辑推理 10 题「丁,南京」应为「丁,北京」部分推断错误,社区评价「快但深度不如 Pro」;thinking levels 四档(minimal/low/medium/high)是发布亮点,medium 档在发布时仅 3.1 Pro 与 3 Flash 独有;中文评测观察到 high 档「接近一半问题输出跑到 64K 上限」,明显可用更低 token 回答却跑满——过度推理倾向被点名为「Reasoning Trap」(HN FoodTruck Bench 帖)。
社区反馈 · 中文
中文社区以「普惠核弹」「王炸」叙事为主,知乎 302.AI/新智元转载热度高;「定价只有 Claude 1/5、GPT 1/4」「你现在免费用的默认模型,能力已经能和别家付费旗舰平起平坐」成主流认知;V2EX 用户实测「速度快、工具调用也稳,基本能顶住日常 workflow」,但「香港居然也用不了」区域限制吐槽真实存在,需中转(OpenRouter/302.AI 转售成生态一部分);中文创作专项反馈较少,整体无负面,关注点集中在价格与区域可用性。
升级共识
从 2.5 Flash 升级值得:SWE 78% 反超旗舰、1M/64K 规格、thinking 四档、官方 3x 提速 + 30% token 节省——「轻量反杀」叙事有硬数据支撑(第三方横评复现 78.0%)。但两个代价要看清:价格较 2.5 Flash 上涨(+66.7%/+20%),幻觉与不确定性感知弱需人工复核;若已在 2.5 Flash 上跑成熟流水线,r/LLMDevs 共识是「没理由迁移」,等 3.5/3.6 降价再动更划算。
榜单与实测落差
「分数高、体感基本一致」的少见案例:SWE-bench 78% 反超 Pro 在真实工作流里成立(GithubCopilot 用户 daily driver 实证、ChatGPT 官方 fast 路径选用),前端复刻知乎实测「最还原」;落差主要在推理深度与幻觉——GPQA 90.4% 高分 vs 知乎逻辑题部分推断错误、r/Bard「hallucinations way too frequent」,官方模型卡「unjustified refusals -10.4%」解释了根因(更敢说 = 更多幻觉);缓解方案是 thinking 档位下探(minimal/low 处理简单任务)+ 关键输出人工复核。
数据来源
本页由仓库 content/models/gemini-3-flash.md 初始化。后续修订通过公开审核队列发布。