跳转到内容

模型:DeepSeek-R2

来自封神榜 Wiki
名称 DeepSeek-R2
厂商 DeepSeek(深度求索)
发布日期 2026-07-08
上下文 256k
最大输出 96000
价格 $1.5/$6
定位 深度推理特化

deepseek-r2deepseek68.9推理、算法、数学

模型content/models/deepseek-r2.md

一句话点评

推理链最深的模型,算法与数学场景首选。

社区反馈 · 编程

R2 定位是推理而非编码主力:SWE-bench Verified 68.9%(站点基线)低于 DeepSeek 自家 V4-Pro 的 76.4%(localaimaster 2026-06 口径)与 V3.2 的 73.1%,社区共识「编码主 V4、难题主 R2」;r/ClaudeCode 实测「日常任务可用,多文件重构/安全相关 Opus 仍有优势」;harnesses.ts 显示 Aider 适配 88% 全站最高,但 20-40K 思考链在 agent 场景需预算控制,否则单文件修改等简单任务也动辄数分钟。

社区反馈 · 推理

核心卖点即推理链深度:数学竞赛题 20K-40K thinking tokens、约为常规模型 100 倍(Spheron 部署指南实测);R1-0528 官方 AIME 2025 87.5% 是家族基准,R2 专项成绩官方未披露;Linux.do「新思维链以 I am 开头」487 赞热帖印证链式思考已是社区话题。分歧在成本与可控性:预算提示可砍 40-60% 思考量、classifier 路由可砍 70-80%(Spheron),但 R2 对提示的遵循只是「比 R1 更稳」(原话 somewhat more consistently),复杂题仍会无视提示拉满链长。

社区反馈 · 中文

中文算法/数学社区热捧:站内 case-algo 攻略「算法周赛登顶记」7.9k 阅读,知乎期待值拉满(「大家现在对 V4/R2 的期待值拉满」),剧透文(Hybrid MoE 3.0 / 1.2T / 成本暴降 97.3%)流传但未经证实;中文创作与日常闲聊专项反馈较少,无明显新增负面;审查与 R1 一脉相承(R1 时代 Promptfoo 1156 题 85% 拒绝率),R2 无专项评测。

升级共识

推理党值得升:R1 → R2 是推理链的质变(12-23K → 20-40K thinking tokens),数学/算法/周赛场景口碑第一梯队,站内 case-algo 攻略 7.9k 阅读背书,官网实测「比 R1 好十倍」(r/ollama)。编码党建议观望:SWE 68.9% 反而低于 V3.2(73.1%)与 V4-Pro(76.4%),日常编码「编码主 V4、难题主 R2」已成共识;且思考链极慢、预算提示非 100% 生效。预算敏感玩家可等 V4-Flash 系(更便宜更快)或继续用 R1-0528($0.55/$2.19)——R2 的 $1.5/$6 加思考全计费,价差需要真实难题才赚得回来。

榜单与实测落差

「推理名副其实、工程名不副实」:40K 思考链与数学/算法口碑和体感一致,是社区公认的推理之最;但若按推理名声期待编码表现会明显失望——SWE 68.9% 不及自家 V3.2/V4-Pro,也不在闭源第一梯队(Opus 5 97.0%、GPT-5.6 Sol 96.2%)。落差第二源是速度:20-40K 思考链把 TTFT 拉到数秒(8K 思考 p50 ~6s @8×H100),「别催它交卷」从梗变成日常负担。缓解方案:预算提示/classifier 路由砍 40-80% 思考量(Spheron),编码任务分流 V4-Flash,只把 R2 留在真正的高难推理上。

数据来源

本页由仓库 content/models/deepseek-r2.md 初始化。后续修订通过公开审核队列发布。