模型:Doubao Seed 2.0
| 名称 | Doubao Seed 2.0 |
|---|---|
| 厂商 | 字节跳动 ByteDance |
| 发布日期 | 2026-02-14 |
| 上下文 | 256k |
| 最大输出 | 128000 |
| 价格 | $0.47/$2.37 |
| 定位 | 掀桌性价比屠夫 |
doubao-2-0doubao76.5性价比、多模态、数学
模型content/models/doubao-2-0.md
一句话点评
数学多模态登顶、价格砍到国际前沿十分之一的掀桌组合:AIME 98.3、12/19 基准第一;代价是文风油腻、幻觉翻车。
社区反馈 · 编程
Code 版是显著亮点:SWE-bench Verified 76.5、LiveCodeBench v6 87.8,纯强化学习训练,官方定位「适配 Claude Code 等 IDE 工具链」(腾讯新闻赛博禅心整理,附 79 页 Model Card);TRAE+Code 在 bash 编码评测 78 分超 Claude 4.5 Sonnet 的 70(r/LocalLLaMA 实测),官方称成本降 62.7%。但社区实测分化:V2EX「方舟 Coding Plan 值得买吗」11 条回复中仅 1 条正面(jixule「CC+Doubao-Seed-2.0-pro 改一些小问题还是挺快的」),其余集中吐槽隐藏倍率、额度低、响应慢(suguss「响应速度极慢,体验极差」、ebushicao「不值得买……glm-5.1 是最佳选择」)。高难基准与国际领先仍有差距,旧版 Pro 编程相对弱。
社区反馈 · 推理
数学是核心强项:AIME 2025 98.3、Codeforces 3020、GPQA Diamond 88.9、HLE-text 54.2(人类最后考试最高分)、IMO 35/42 金牌级,SuperGPQA 超 GPT-5.2、HealthBench 第一、FrontierSci 部分场景超 Gemini 3 Pro(腾讯新闻整理)。官方称「从奥赛迈向研究级推理」,能尝试埃尔德什级别数学问题。但复杂归纳推理依赖暴力穷举,空间智力弱、「找不到正确思路」;深度研究「找资料→归纳→写结论」长链路是官方主推卖点(BrowseComp 77.3、Terminal Bench 55.8)。
社区反馈 · 中文
知乎「为什么豆包模型实际很强却被低估」逐项评分:搜索 4 星、中文搜索 4.5 星、认知深度 4.7 星,日常问答/文案润色/中文创作更高效;但风格驾驭仅 2 星(「油腻、装逼味儿,网厂经理味儿很浓」),需额外提示词去味。作为 1.55 亿周活中国第一 AI 聊天机器人背后的模型,中文知识广度与搜索是护城河,海外 HN 声量却极小(发布帖仅 15 pts)——中文口碑与英文冷遇形成镜像。
升级共识
性价比/多模态/数学场景形成强共识,2.0 值得升级:$0.85 blended 交付 85-90% 前沿性能(TokenMix),AIME 98.3 与多模态 12/19 第一是硬指标,10 亿输出 token 月费 $2,370 vs GPT-5.2 的 $14,000(Toolworthy)。编程场景用 Code 版 + TRAE 有明确替代价值(bash 78 vs 70 超 Claude 4.5 Sonnet,成本降 62.7%),但方舟 Coding Plan 套餐体验分化——V2EX 实测隐藏倍率、额度低、响应慢,仅「改小问题」级任务口碑正面。写作/风格场景口碑未定,建议等 2.1 打磨版再切;严肃法律/外语场景需警惕幻觉(编造法律条款先例)。
榜单与实测落差
榜单数学与多模态全面登顶(AIME 98.3、19 项基准 12 项第一、HLE-text 54.2 破纪录、SuperGPQA 超 GPT-5.2、HealthBench 第一),实测却「分数高、文风差」:知乎认知深度 4.7 星而风格驾驭仅 2 星,幻觉在严肃法律/外语场景「一本正经胡说八道」(80aj 转载帖阅读 505)。编程侧榜单 76.5 与实测的「慢、额度坑」并存——SWE-bench 高分的 Code 变体在方舟套餐里被倍率与延迟拖累(V2EX 11 条回复仅 1 条正面)。根因是风格约束与事实校准不足、Coding Plan 计费设计反噬体验,而非能力缺陷;Code 版 + TRAE 补足编程短板,2.1 Pro 再按社区反馈补强空间智力与归纳推理。
数据来源
本页由仓库 content/models/doubao-2-0.md 初始化。后续修订通过公开审核队列发布。