跳转到内容

模型:DeepSeek-R1

来自封神榜 Wiki
名称 DeepSeek-R1
厂商 DeepSeek(深度求索)
发布日期 2025-01-20
上下文 128k
最大输出
价格 $0.55/$2.19
定位 开源推理先锋

deepseek-r1deepseek50推理、性价比、开源

模型content/models/deepseek-r1.md

一句话点评

开源推理里程碑:数学登顶、白菜价惊艳全球,却因安全越狱与审查争议遭双重审视——便宜能打,也代价分明。

社区反馈 · 编程

两极分化是 R1 最鲜明的画像:竞赛编程 Codeforces 96.3% 百分位(Rating 2029,仅比 o1 低 32 分)顶级,0528 版 Aider-Polyglot 56.9%→71.6%(+14.5pts)获 r/LocalLLaMA 高赞、Aider 作者 Paul Gauthier 发推称全场第 3;但工程编程落差明显——SWE-bench Verified 官方 49.2%(还低于 Claude 3.5 Sonnet 的 50.8%),OpenHands 实测仅 34%(issue #6466),REXBENCH 12 个科研扩展任务执行成功率 0%(对比 OpenHands+Claude 4 Sonnet 的 33%)。Cursor 论坛实测「单文件强、多文件弱」:找 bug、算法设计一次过,跨文件上下文保持不住;社区通行玩法是「R1 出思路 + Claude 3.5 Sonnet 当 editor」——Aider 官方验证该组合超越 o1。框架适配比模型更决定成败:WebGen-Bench 里 OpenHands+R1 仅 10.2%,换 Bolt.diy 后 R1 以 27.8% 反超全部闭源模型。

社区反馈 · 推理

推理是 R1 名副其实的招牌:MATH-500 97.3%、AIME 2024 79.8% 双超 o1(96.4%/79.2%),初等数学 97% 冠绝当时开源界;0528 版 AIME 2025 从 70% 冲到 87.5%,VentureBeat 称「与 o3 性能接近但无需极端设置」。范式层面,R1-Zero 纯 RL 训练自发涌现「顿悟时刻」、论文登《自然》,被视为推理模型训练范式转折点。但 agentic 场景推理溢价有限:METR 评测 76 个自治任务上 R1「仅略优于 o1-preview、相当于 2024 年 9 月前沿水平」,且「思考链冗长拉高延迟、function call 偶发幻觉」。社区体感两极:HN 热评称 8B 蒸馏版能力迁移惊人,dimgl 则直言「overhyped trash,榜单强、实战拉胯」;多轮追问质量崩塌是 V2EX 集中槽点。

社区反馈 · 中文

中文首次回答靠谱、适合国内问题沟通,官方中文榜单 C-Eval 91.8、C-SimpleQA 63.7 均列第一梯队;但创意写作/文学不如 Claude Sonnet,长尾任务(哲学思考、中文诗歌、算命)反有意外脑洞——HN 上甚至出现基于 R1 的 BaziAI 算命产品。审查是中文场景最大变量:Promptfoo 1156 题测试涉台独/文革/天安门等争议话题拒绝率约 85%,arxiv R1dacted 证实审查嵌入模型权重层、91.2% 回答呈亲华倾向——本地部署(MIT 权重)或 abliterated/Perplexity r1-1776 去审查版是绕过手段,但会损失对齐。

升级共识

0528 版 Aider-Polyglot 56.9%→71.6%(+14.5pts)属显著跃升而非渐进迭代,WebDev Arena 并列第 1、Aider 作者 Paul Gauthier 亲自发推背书,社区共识「不再偷懒,愿意尝试难题」——升级值得;但思考 token 12K→23K 带来延迟与成本双升,多数 provider 速度仅为 Gemini 2.5 Pro 的 ~50%,简单任务反而过度思考。对纯推理/竞赛/高性价比用户,R1-0528 是 2025 年开源首选;对工程编程多文件任务,社区仍倾向「R1 出思路 + Claude 当 editor」的组合而非单挂 R1。

榜单与实测落差

数学推理名副其实(MATH-500 97.3% 与体感一致),但 agentic 编程「分数高体感差」链条完整:SWE-bench 官方 49.2% 低于 Claude 3.5 Sonnet 的 50.8%,OpenHands 实测仅 34%,METR 判定 R1「只相当于 2024 年 9 月前沿水平」且推理期算力在自治任务上提升「surprisingly」有限,REXBENCH 上执行成功率 0%。根因是榜单多测单轮/单题,而 agent 任务依赖函数调用与长上下文保持——R1 初版无原生 function calling(METR 需 code-fenced 块绕行)、多轮追问崩塌,恰是工具链的命门;缓解用 0528 版(新增 function calling)+ 缓存命中价 $0.14,或「R1 推理 + Claude 编辑」双核组合。

数据来源

本页由仓库 content/models/deepseek-r1.md 初始化。后续修订通过公开审核队列发布。