模型:DeepSeek V4 Flash
| 名称 | DeepSeek V4 Flash |
|---|---|
| 厂商 | DeepSeek(深度求索) |
| 发布日期 | 2026-07-31 |
| 上下文 | 1M |
| 最大输出 | 384000 |
| 价格 | $0.14/$0.28 |
| 定位 | 性价比之王 |
deepseek-v4-flashdeepseek79性价比、开源、Agent
模型content/models/deepseek-v4-flash.md
一句话点评
白菜价贴脸前沿智能:Agent 跑分翻 7 倍、SWE 逼近 Pro;代价是 token 啰嗦与幻觉偏高,跑分还藏着未开源 Harness 的红利。
社区反馈 · 编程
基准接近 Pro:SWE-bench 79.0 vs 80.6、LiveCodeBench 91.6 vs 93.5,Agent 编码 DeepSWE 从 7.3 飙到 54.4;实战分化——HN 称「几便士写一天代码、无 token 焦虑」,DevelopersDigest 确认为其站点生产环境日常使用,christophilus 用 opencode 实测「与 Codex/Claude Code 几乎无差别」、jmathai 表示「成本低到能给产品开 generous 免费层」;但 V2EX 称「coding 场景 v4 pro 都不如 glm5.1」、nwienert 实测「0731 final 比 preview 慢约 2.5 倍、reasoning 绕圈 5 倍长」、debazel 的 Rust+OpenGL 纹理问题 2 小时未解、r/opencode 用户实测 token 用量偏大。分歧源于场景与框架差异:简单任务零翻车,复杂图形栈/长链规划翻车概率明显更高。
社区反馈 · 推理
Think Max 档是主战场:AA 智能指数 Max 档 52 分、非推理仅 36 分,差约 16 分;GPQA Diamond 91%、HLE 37%、SciCode 50%;ARC Prize 独立验证 ARC-AGI-1 Semi-Private 89.0%($0.02/任务)创同价位纪录、ARC-AGI-2 61.4%($0.04/任务)——每任务成本比 Luna 低约一个数量级;但达到 GPT-5.6 Luna 同等结果需约 5 倍 token 且 TPS 更低,WhitneyLand 称效率为 Gemini 3.6 Flash 的 1/3.6,nwienert 直言「最轻微的提示词含糊它都会来回绕圈」。
社区反馈 · 中文
中文社区反馈偏负面:V2EX 用户用 2 亿 token 后称「没体验出智能」、900k 剧本长记忆召回差;非推理模式复杂指令不遵循、被迫切到 Kimi;Linux.do 另吐槽「不是…而是」句式,中文风格对齐是短板。多数差评针对 Preview 或非推理模式,0731 正式版中文专项反馈尚少;官方 8 月初已公告「大幅涨价」预告,国内 ¥1/¥2 定价的「10M token 仅约 ¥2」窗口期能维持多久存疑。
升级共识
Agent/Coding 工作流是质变级升级:SWE 距 Pro 仅 1.6 分、输出便宜约 3 倍,默认 Flash、验证失败再升 Pro 的策略普遍成立,值得直接换;但跑分含未开源 Harness 的红利、Arena -16 分存在落差,且 8/06 官方已预告「大幅涨价」、final 版较 preview 慢 2.5 倍——不急于求成的用户可等 V4-Pro 正式版与涨价细则落地再定夺。
榜单与实测落差
跑分登顶与体感分化并存:正向在 coding/性价比——HN 多人称「几便士写一天代码」、r/opencode 实测 $60 内 15.8 万请求/月、DevelopersDigest 生产环境日常使用、christophilus 称 opencode 实测与 Codex/Claude Code 几乎无差别、jmathai 成本低到开免费层;负向在中文长记忆、非推理模式指令遵循、token 效率(3.6–5 倍)、final 较 preview 慢 2.5 倍(nwienert:reasoning 疯狂绕圈)与 Arena -16 分。根因是跑分用未开源的 DeepSeek Harness 极简模式 + max 档测得,框架红利直到 8/09 第三方公开 harness 复现 82.7% 才部分缓解;缓解:默认 Think Max 档、依赖稳定提示词吃缓存命中折扣,中文复杂指令任务先小样验证。
数据来源
本页由仓库 content/models/deepseek-v4-flash.md 初始化。后续修订通过公开审核队列发布。