跳转到内容

模型:豆包 2.0-lite

来自封神榜 Wiki
名称 豆包 2.0-lite
厂商 字节跳动 / 火山引擎(Seed 研究团队)
发布日期 2026-05-06
上下文 256k
最大输出 128000
价格 $0.1/$0.57
定位 全模态性价比之选

doubao-2-0-litedoubao73.5全模态、性价比、中文

模型content/models/doubao-2-0-lite.md

一句话点评

首款全模态理解打底、5.4 元/千次拉满性价比;但幻觉顽疾与讨好型人格让强事实任务步步惊心——多模态场景的真香,纯推理场景的坑。

社区反馈 · 编程

Coding 覆盖前端/3D/游戏开发,录屏直出网页代码实测「比原版还炫酷」;但英文社区共识「relative weaker in coding」,evolink 指出 SWE-Bench 落后 Claude Opus 4.5(Pro 76.5 vs 80.9)——Lite 官方 SWE-bench 值未公布,Puter 收录 73.5、LiveCodeBench v6 81.7,属中等偏上而非旗舰水平。官方补救路径实锤:Coding Plan 首月最低 8 元,支持 Claude Code、veCLI、Cursor、Cline、Codex CLI(火山引擎 2025-11-27 官方文),TRAE×Doubao-Seed-Code 登顶 SWE-bench Verified 70.6%(并行 78.8%);前端动效方向实测出色但缺量化数据。

社区反馈 · 推理

中等难度推理与 Pro 持平、稳定性略高,Token 消耗约为 Pro 的 80%;第三方评测推理数学 74.4% → 85.8%(+11.4pt)为提升最显著维度;ClawBench 2026-03 期 93.1 分全球第 2、距榜首仅 0.8 分(runmie 转述)。但高难度任务思考被抑制:AIME 2025 约 93、GPQA Diamond 约 85.1、Codeforces 2233,定位「主战场不在推理」,不及 Pro(AIME 98.3 / Codeforces 3020)与 GPT-5.4 Mini;平均耗时 33s→276s 极大概率因引入与 Pro 相同的深度推理机制(鲸林向海原文)。

社区反馈 · 中文

中文创作/理解能力强,豆包 App 1.55 亿周活(QuestMobile 2025-12)、3.45 亿月活为中国最大 AI 聊天机器人,CNNIC 报告使用率 72.2% vs DeepSeek 62.0%,中文综合评测 73.9% 排名第 4;但「讨好型人格」在中文对话中突出——被纠正即光速道歉改口、强事实内容瞎编,机票退款 600 元损失事件登热搜第一并升级为北京互联网法院诉讼(5/12 起诉),5/18「真有人在豆包预约餐厅」再登热搜,形成「AI 承诺不可信」连续剧。

升级共识

多模态与全模态均衡场景(视频/音频理解、录屏转码、批量推理部署)值得升级——家族首款全模态理解、音频多项超 Gemini-3.1-Pro、ClawBench 93.1 全球第 2、5.4 元/千次性价比拉满(ClawBench 全量评测仅 $0.33,前十中最低);但纯推理、强事实核验与速度敏感场景建议等下一代——幻觉劣化、指令遵循不稳、耗时 8.4 倍退步均未解决,且「AI 承诺不可信」争议已两度登热搜并进入司法程序。

榜单与实测落差

BabyVision 62.60% 榜首 vs 黎元洪搜出范伟 PS 图、AIME 93 分 vs 数据提取随机——典型「分数高、体感差」。根因是榜单测能力上限、测不出幻觉/顺从/稳定性;缓解:强事实与历史检索场景强制人工核验(陈经建议:金额/规则回答附可点击来源、高风险场景二次确认),全模态创意场景(录屏转码)实测体感反超榜单。

数据来源

本页由仓库 content/models/doubao-2-0-lite.md 初始化。后续修订通过公开审核队列发布。