模型:Llama 4
| 名称 | Llama 4 |
|---|---|
| 厂商 | Meta(Meta AI / FAIR) |
| 发布日期 | 2025-04-05 |
| 上下文 | 10M |
| 最大输出 | |
| 价格 | 开源 |
| 定位 | 开源翻车 |
一句话点评
开源史上最大翻车:官方成绩被 LeCun 亲口承认 fudged,实测编程 15.6%、SWE 仅约 24%,有长度没质量,社区共识为全面倒退。
社区反馈 · 编程
共识是最短板:Aider Polyglot 实测仅 15.6%,Reddit 帖直书 "I strongly advise against using Llama 4 for coding"(476 赞帖正文);官方宣称 SWE-bench 41.8% 但第三方复现仅约 24%,同期 DeepSeek V4 Pro 达 80.6%、Qwen 3.6-27B 达 77.2%;甚至被比它小得多的 Qwen2.5-Coder-32B(16.4%)反超。官方 LiveCodeBench 43.4%(Maverick)与第三方实测落差巨大,rootly.com 专门发文《Llama 4 underperforms: a benchmark against coding-centric models》。
社区反馈 · 推理
2025-04-05 初版为非推理模型,数学与逻辑弱于 DeepSeek V3;但 Epoch AI 独立复现 GPQA Diamond Maverick 67% / Scout 52%,与官方宣称的 69.8% / 57.2% 基本吻合,并非全盘注水。2025-04-29 发布推理版 Llama 4 Reasoning 17B(Maas API,547↑ Reddit 帖),官方话术从「不推理」转向补推理短板;社区共识 Maverick 智能约等于 GPT-4o-0806 旧版(Artificial Analysis 复现),不足以激励迁移。
社区反馈 · 中文
无明显优势且偏弱:官方 12 种支持语言不含中文,AI 超元域实测「中文 OCR 表现不及预期」;知乎评测指出 DeepSeek V3 以中文能力见长,Llama 4 中文创作/理解乏善可陈;社区缺乏专门好评,反观 Qwen 系列在中文场景更受推荐,中文用户普遍转向国产开源。
升级共识
社区共识明确「不值得升级」:编程/推理/日常问答全面落后 DeepSeek 与 Qwen 系,「等下版」是主流意见;Epoch AI 复现虽证明 GPQA Diamond 官方分数基本可信(Maverick 67% vs 官方 69.8%),但社区体感仍差——Artificial Analysis 定位 Maverick ≈ GPT-4o-0806 旧版、Scout ≈ Mistral Small 3.1 / Gemma 3 27B,均不足以构成迁移理由;仅超长上下文(Scout 10M)与多模态图文输入且能接受 50GB+ 显存部署门槛的用户可考虑,且需自行验证「有长度没质量」——Fiction.liveBench 128K 仅 15.6%(Gemini 2.5 Pro 90.6%)、4-bit 量化 5M 后困惑度 +15-20%。
榜单与实测落差
落差极大,「分数高但体感差」是最大痛点:官方 SWE-bench 41.8% vs 第三方复现约 24%,Aider 实测编程仅 15.6%,官方 LiveCodeBench 43.4% 与第三方 Aider 实测 16% 完全脱节;LMArena 特调版 ELO 1417 第 2 vs 开源版第 32,落差 30 名。根因是送测特调版与开源权重并非同一模型,加上发布仓促(据 The Information,DeepSeek 冲击下 Meta 内部恐慌、多次推迟后赶 4 月底 Deadline 交付);缓解:以 Aider/第三方复现成绩为准绳,把 10M 上下文当营销参数、按约 5M 有效窗口规划任务,编程槽位一律换 DeepSeek V3.2 或 Qwen3。
数据来源
本页由仓库 content/models/llama-4.md 初始化。后续修订通过公开审核队列发布。