模型:DeepSeek V3.2
| 名称 | DeepSeek V3.2 |
|---|---|
| 厂商 | DeepSeek(深度求索) |
| 发布日期 | 2025-11-27 |
| 上下文 | 160K |
| 最大输出 | 66000 |
| 价格 | $0.22/$0.33 |
| 定位 | 开源性价比之王 |
deepseek-v3-2deepseek73.1性价比、开源、中文
模型content/models/deepseek-v3-2.md
一句话点评
以 $5.576M 训练成本把开源推到 frontier 边缘,编程数学双双开源登顶却被联网幻觉拖后腿——极致性价比之下,口碑在 V3.2 正式版迎来逆转。
社区反馈 · 编程
社区反馈编码体验接近 Claude 3.5 Sonnet(r/LocalLLaMA 高赞帖「it work well, similar to Claude 3.5 Sonnet」);官方自带 harness 下 SWE-bench Verified 73.1%、Terminal Bench 2.0 46.4%、LiveCodeBench 83.30 均为开源最高。但 OpenHands 公开 harness(v1.8.3 deepseek-v3.2-reasoner)实测 SWE-bench 仅 45.1%(benchlm.ai 标 45.7%),与官方 73.1% 差距明显——agentic 场景的「榜单 vs 实测」落差有硬数字佐证。Claude Code 经 Anthropic 兼容端点直连后质量「接近西方旗舰模型的零头成本」(Krzysztof Karczewski 2026-01 实测),但 128K 上下文易触顶、模型膨胀上下文更激进。Cursor 未原生上架 V3.2,BYOK 模式下第三方实测 20 条 vibe coding prompt 成功 14/20(70%),多文件上下文与创意 UI 偏弱(TokenMix 2026-04)。
社区反馈 · 推理
数学推理是 V3 系列核心强项:MATH 82.4%(V3-0324)超 GPT-4o 的 76.6%,AIME 2025 93.1%;V3.2-Speciale 拿下 IMO 2025 金牌(35/42)、IOI 2025 492/600 全球第 10、ICPC WF 2025 第 2。Baseten 深潜指出 Speciale 推理常匹配/超过 Gemini-3.0-Pro,但 token 消耗为闭源同行 1.5-2 倍(Codeforces 2701 分平均 ~77k 输出 tokens vs GPT-5/Gemini 的 22-29k)。Zvi Mowshowitz 泼冷水:「all signs are that it underperforms its benchmarks」「不是前沿模型」(thezvi.substack.com,2025-12-05);Reddit 亦有「far behind OpenAI because it's not all about those percentages」的质疑帖。社区共识:数学/算法体感与分数吻合度高,别拿总分当推理水平。
社区反馈 · 中文
中文推理/理解被社区视为国产模型天花板,中文逻辑、成语理解、古诗词赏析优于 GPT-5(CSDN 评测);但网页版「不管问什么它都要先夸一下我的问题」的谄媚毛病被 V2EX 用户吐槽(t/1231342),「以前 V3 没这臭毛病的」。Reddit 亦有英文用户抱怨「don't understand basic English if say hello so defaults to Chinese」的中英混杂问题(r/DeepSeek 266 赞帖楼内)。V3.2 正式版基于社区反馈改进了写作与稳定性,「3.2 is just crazy good!」口碑逆转(r/DeepSeek 266 赞帖);身份误认也有官方解释——模型不自知版本号,除非系统提示写明。
升级共识
社区普遍认为 V3.2 正式版值得升级——「3.2 is just crazy good!」(r/DeepSeek 266 赞帖)扭转 V3.1 口碑,「Yes, it was worth the wait」(楼内 21 赞);V3.1 用户升级收益明显,V3.2-Exp 用户已获正式版无需再动。注意 Speciale 端点已于 2025-12-15 下线(纯推理、无工具调用),竞技级推理请等下一正式版。2026-08 DeepSeek 宣布 API 大幅涨价后,「性价比」叙事承压,社区出现转向 Mimo/GLM 等替代的声音——MIT 开源权重可自部署的选项因此被更看重,长期主义者建议自部署而非纯 API 依赖。
榜单与实测落差
分数高但体感因场景而异:官方自带 harness 的 SWE-bench Verified 73.1%,OpenHands 公开 harness(v1.8.3)实测仅 45.1%——agentic 场景的「榜单 vs 实测」落差有硬数字佐证。编程/数学体感与分数吻合度高(Baseten:Speciale 推理常匹敌 Gemini-3.0-Pro,但 token 消耗 1.5-2 倍);联网搜索与事实核查体感却远低于分数暗示(Misguided Attention eval 仅解决 22% 测试题,7 分钟速通被说成 7 秒),根因是幻觉与过拟合(疑似 KV cache 压缩副作用)。Zvi Mowshowitz 直言「underperforms its benchmarks」「不是前沿模型」(thezvi.substack.com);社区共识:按场景选模型,别按总分选——联网场景建议关闭「深度思考+联网」或换用事实核查流程。
数据来源
本页由仓库 content/models/deepseek-v3-2.md 初始化。后续修订通过公开审核队列发布。