跳转到内容

模型:Llama 5 Maverick

来自封神榜 Wiki
名称 Llama 5 Maverick
厂商 Meta(Meta AI / MSL)
发布日期 未发布
上下文 未公布
最大输出
价格 未定价
定位 未发布 · 在训旗舰

llama-5-maverickllama0未发布、泄漏、开源待定

模型content/models/llama-5-maverick.md

一句话点评

尚未发布:泄漏代号 Watermelon,内部基准自称匹配 GPT-5.5;开源/闭源未定,无任何公开成绩。

社区反馈 · 编程

泄漏主打方向:Wang 预告「Opus 级编程模型 pretty soon」(X,2026-07-06),Muse Code(闭源编程旗舰,HN 332 pts)被视为 Meta 编程补课的先导证据。但前代账要还:Llama 4 Maverick Aider Polyglot 实测仅 15.6%、SWE-bench 第三方复现 ~24%(DeepSeek V4 Pro 80.6%、Qwen 3.6-27B 77.2% 同期对照),社区共识「编程短板要从头补」;且 2026 年 Meta 内部开发已改用 Claude Sonnet(量子位),自家编程实力存疑。Llama 5 自身零实测。

社区反馈 · 推理

唯一「成绩」是 Wang 内部自证「匹配 GPT-5.5」(未点名 benchmark、未独立复现、Meta 拒评);AI Weekly 点破这是「堆算力追平而非架构巧思」,且 OpenAI 已于 6 月底限量预览 GPT-5.6 抢先半步。前代唯一可信推理成绩是 Epoch 复现 GPQA Diamond Maverick 67%(与官方 69.8% 基本吻合),但无法外推 Llama 5;加上 Llama 4 刷榜前科(LeCun 2026-01 承认 "results were fudged"),社区对内部基准普遍「先别信」。

社区反馈 · 中文

专项反馈 0 条(未发布模型不可能有);Meta 中文能力历来偏弱(Llama 4 官方 12 种支持语言不含中文、中文 OCR 不及预期)。中文社区讨论聚焦两件事:量子位《Llama惨遭抛弃!Meta内部改用Claude写代码》的负面叙事、以及「从开源折戟到闭源破局」的 Muse Spark 转向解读——对 Llama 5 的中文能力无任何期待性正面,反而担忧开源路线终结。

升级共识

无从升级——模型未发布。开源党在等「weights 落地」("llama brand too strong to abandon"),闭源务实派在等「API 可用」(Muse Spark 已是现役,1.2 版 08-05 刚发);对两者共同的前置警告:Llama 4 的 SWE 41.8% 官方宣称被证伪为 ~24%,「匹配 GPT-5.5」属内部自证,发布后必须看第三方复测再决定迁移;当前需要 Llama 系能力的用户先用 Muse Spark / Muse Code,需要开源权重的先上 DeepSeek V4 / Qwen 3.6 系。

榜单与实测落差

无成绩可比——泄漏称「匹配 GPT-5.5」,但 AI Weekly 点破这是「堆算力追平」而非架构巧思,且 OpenAI 已限量预览 GPT-5.6 抢先半步;加上 Llama 4 刷榜前科,「分数可信度」成为比「分数高低」更大的问题。真正落差要等发布后独立复测;缓解之道:以 Manifold 1.9%(2027-01 前)的现实预期管理心态,发布后先看 Aider Polyglot 与第三方 SWE 复现(前代 15.6% / ~24% 的及格线)。

数据来源

本页由仓库 content/models/llama-5-maverick.md 初始化。后续修订通过公开审核队列发布。