跳转到内容

模型:DeepSeek-V4

来自封神榜 Wiki
名称 DeepSeek-V4
厂商 DeepSeek(深度求索)
发布日期 2026-02-11
上下文 512k
最大输出 64000
价格 $0.8/$2.4
定位 高性价比开源主力

deepseek-v4deepseek74.2性价比、开源、代码

模型content/models/deepseek-v4.md

一句话点评

以约十分之一的旗舰价格,提供八成以上的代码能力。

社区反馈 · 编程

两极分化:SWE-bench 80.6% 追平 Opus 4.6、LiveCodeBench 93.5% 登顶,HN 发布帖 2091 分坐实开源第一梯队;HN 高赞实测「v4 Pro feels like Claude Opus 4.6 in personality」「most usable coding model I've seen out of China」。但 DeepSWE 从零构建任务仅 8% pass@1(GPT-5.5 70%、Opus 4.7 54%),Reddit 争论激烈,morphllm 定性 80.6%「处于 loose verifier harness 顶部」;HN 亦有负面实测「在 Claude Code 里会疯狂读文件/日志」。V4-Flash-0731 re-post-training 后 DeepSWE 7.3→54.4,9 项 Agent 基准反超 Pro,8/09 开源 harness 公开复现 Terminal-Bench 82.7,部分化解争议。

社区反馈 · 推理

知乎逻辑评测称其「一道清澈而纯粹的光」,多步逻辑链、跨文档推理上限高;6/08 HN 帖「DeepSeek V4 Pro beats GPT-5.5 Pro on precision」397 分,precision 成为独立叙事线;但 NIST/CAISI 官方页(2026-05-01)以 IRT 判定距美国前沿约 8 个月(官方自评约 2 个月),HN 评论亦指「trail SOTA by about 6-12 months」,复杂 Agent 自动化任务仍有差距。

社区反馈 · 中文

国产顶流,中文理解与创作自然流畅,社区无显著负面;知乎/36氪/CSDN 普遍认可「国产顶流」身份;HN 讨论则常滑向地缘政治之争(Reddit 转引帖标题直指此事)。仅实测稳定性有批评:「没想象中好,能力表现不稳定」。

升级共识

编程与 Agent 场景值得升级:Pro 优于 Sonnet 4.5、接近 Opus 4.6 非思考模式(知乎高赞),HN 用户实测「on par with GPT-5.4 or Opus 4.6」,DeepClaude 企业实测「成本节省大到无法忽视」;非编程场景体感提升有限、稳定性存疑(知乎「能力不稳定」、3 月 13 小时宕机、NIST 判距前沿 8 个月)可等正式版;Flash 性价比普遍认可——「good enough for (almost) everything」,但 8/06 已预告涨价,性价比窗口正在收窄。

榜单与实测落差

「分数高体感差」典型:SWE-bench 80.6%、LiveCodeBench 93.5% 顶尖、HN 六帖 380+ 分,但 NIST/CAISI 官方页判定距前沿约 8 个月、DeepSWE 仅 8% pass@1、3D 物理交互实测垫底(小球未弹起)、HN 负面实测「用很多 token 才把活干完」。根因是榜单基于继承 PR 测试、位于 loose verifier harness 顶部(morphllm 定性),与真实工程能力存在落差;V4-Flash-0731 re-post-training 后 9 项 Agent 基准反超 Pro,8/09 公开 harness 复现 82.7%,部分修正「分数虚高」质疑。

数据来源

本页由仓库 content/models/deepseek-v4.md 初始化。后续修订通过公开审核队列发布。