跳转到内容

模型:Mistral Large 3

来自封神榜 Wiki
名称 Mistral Large 3
厂商 Mistral AI(法国巴黎)
发布日期 2025-12-02
上下文 256K
最大输出
价格 $0.5/$1.5
定位 欧洲开源旗舰

mistral-large-3mistral82.8开源、多语言、多模态

模型content/models/mistral-large-3.md

一句话点评

LMArena 开源非推理第二却体感翻车——Apache 2.0 全开放与原生多模态是实打实的资产,推理短板与榜单落差让社区集体观望。

社区反馈 · 编程

两极分化:HumanEval ~92% 常规代码「clean and modular」,但 LiveCodeBench 数据分歧(llm-stats 34.4% / Medium v6 82.8%)且 4 基准几何均值仅 41.9(vs DeepSeek 3.2 的 83.6 断层);IntuitionLabs 称「在更现代有挑战的编程套件上处于二线水平」。用户实测(HN 46205437)其官方编程栈 Devstral 2「Python 出色、React 差、会丢闭合括号」,作 Claude Code 替代「not bad 但慢」;2026-01 实测(HN 46679872)「Kimi K2、GLM 4.7、Mistral Large 3、DeepSeek 都是 Sonnet 4 级,但远不及 Opus 4.5」。

社区反馈 · 推理

最大短板:GPQA Diamond 独立口径仅 43.9%(vs GPT-5.1 的 88.1%、DS-V3.2/Kimi K2 的 70-85%;官方卡报 67.17 存口径分歧),AAII 仅 16 分(低于同门 Medium 3.5 的 30、Devstral 2 的 19);Medium 评测称「深层次科学和研究生级推理任务上表现显著下降」;HF 模型卡自认「Not a dedicated reasoning model」,HN 用户称「fall really far behind since 2025Q3」;reasoning 版 Magistral 系列(2025-06 首发的 941 分帖家族)始终未覆盖 Large 3 档位。

社区反馈 · 中文

覆盖含中文但非优化重点:知乎/掘金讨论多聚焦架构与开源价值(「欧洲的 DeepSeek」「对标全是中国模型」成主流叙事),对中文实测评价较少;53AI 称「在核心评测上能与 Qwen、Gemma 底模正面硬刚」但无中文专项数据;腾讯新闻指出官方发布对比只对标 DeepSeek-V3.1/Kimi-K2,多语言胜率 57%/60%,侧面说明中文非强项。

升级共识

开源价值与多模态能力获普遍认可:要 Apache 2.0 自托管、欧洲多语言、写作或 OCR 场景值得升级(BNP Paribas 比利时 on-prem 已实证银行级落地);但推理不达标(AAII 16 分 vs Medium 3.5 的 30)、体感低于榜单预期(几何均值 41.9 处于 80 分档断层),深度推理与复杂工程建议等 Magistral 推理版,或留在 Large 2 / 转用 DS-V3.2、GLM-4.6;想用 Mistral 编程栈的话,官方推荐路线其实是 Devstral 2 + Mistral Vibe CLI(SWE-bench 72.2%)。

榜单与实测落差

LMArena 开源非推理 #2(Elo ~1418)却遭实测「impressively bad」——典型「分数高、体感差」。根因是设计偏 System 1 快速匹配,榜单红利集中于传统基准与写作/多模态;HN 顶评 arnaudsm 的 4 基准几何均值(MMMLU+GPQA-Diamond+SimpleQA+LiveCodeBench)把断层量化得很清楚:Gemini 3.0 Pro 84.8 / DeepSeek 3.2 83.6 / GPT-5.1 69.2 / Claude Opus 4.5 67.4 / Kimi-K2 42.0 / Mistral Large 3 41.9 / DS-3.1 39.7——41.9 与 80 分档之间有近一倍的智能差距。推理(GPQA 43.9%)与现代编程短板被榜单遮蔽,写作、OCR、多语言场景可直接用,推理与复杂工程交给 DS-V3.2/Kimi K2 或等 Magistral。

数据来源

本页由仓库 content/models/mistral-large-3.md 初始化。后续修订通过公开审核队列发布。