跳转到内容

模型:MiniMax M3

来自封神榜 Wiki
名称 MiniMax M3
厂商 MiniMax(稀宇科技)
发布日期 2026-06-01
上下文 1M
最大输出
价格 $0.6/$2.4
定位 平替天花板

minimax-m3minimax80.5三件套、多模态、1M 上下文

模型content/models/minimax-m3.md

一句话点评

集齐 Frontier 三件套的开源新王:编程与 1M 上下文惊艳,价格仅闭源前沿的 1/10;但推理个位数、稳定性退步、涨价背刺老用户,强执行弱创新。

社区反馈 · 编程

编程是 M3 最强卖点、也是争议最集中的战场:官方 SWE-Bench Pro 59.0% 超 GPT-5.5(58.6%)、逼近 Opus 4.7(64.3%)。真机证据分两派——andlukyane 在 Claude Code 里实测 100 文件/26k 行仓库审计「约 30 分钟出 12 critical/20 high/30 medium/20 low 分级报告、带路径行号」,修复阶段 2h40m 把测试从 188 推到 237,但 Opus 复核仍挖出 2 个被绿测试掩盖的 critical 回归,他总结「不该让 M3 同时写测试和修代码」;thomas-wiegold 代码审计「no filler, no padding, no inventing problems」,认为 M3「没浪费一行在假问题上」、比 DeepSeek V4 的「大量噪音」强得多。反面:Reddit「M3 thinks for THOUSANDS of tokens and outputs horrible code」帖引发共鸣,多位用户称 M2.7 每次出好代码、M3 频繁语法错误(量化版 q4_k_s 更严重)。HN ignoramous 则给出「M3 at coding equally good, if not better than DeepSeek v4」。社区共识:上限高、稳定性要调教,混合工作流(M3 打底 + 闭源复核)是主流用法。

社区反馈 · 推理

公认短板:ARC-AGI-2 仅个位数,thomas-wiegold 直言「not a good abstract reasoner」;扑克模拟耗时 30-40 分钟、表现为「talk itself into a corner, talk itself back out, and burn a frightening number of tokens... felt less like reasoning and more like brute-forcing」——不过他补充「没有任何模型能一次 100% 通过这个扑克挑战」。302.AI 实测指其颜色组合推理「靠视觉读取结果强靠因式分解」而非真正洞察规则。正面:长程任务规划与自我验证的执行型推理获普遍认可,Claw-Eval 自主 Agent 最高分、24 小时 CUDA 内核优化等长程执行任务表现出色,Reddit 用户称 agentic 工作流「prefer it to opus」。

社区反馈 · 中文

作为国产模型,中文理解自然流畅,知乎多篇评测(302.AI「平替天花板」、深度评测「体感全面超过 Sonnet 4.6」)均以中文撰写、无明显语言问题反馈,V2EX 与知乎讨论活跃、社区认同感强。中文媒体焦点几乎全在商业化而非能力:钛媒体 06-03 报道「指标很强,但社区炒翻了」、开篇即指 M3 发布当日 MiniMax 股价大跌 15%,36氪标题「背刺老用户,MiniMax 吞下苦果」;逸趣网实测算账月 30 亿 token 重度用户成本从 ¥49 涨到约 ¥175(+257%)。中文社区情绪分化最大:认可性价比、愤怒于涨价与许可证。

升级共识

技术能力公认显著提升:编程/Agent/长上下文/多模态场景值得升级——andlukyane 实测 M3 在 Claude Code 里「did a large amount of correct, well-structured work quickly」,thomas-wiegold 称「首次真正坐进 GPT 和 Opus 的对话桌」;HN 用户普遍把它当 DeepSeek V4 同级甚至更强的代码备选。但稳定性退步(thinking loop、语法错误、Opus 复核仍能抓到被绿测试掩盖的 critical 回归)与商业化背刺(+257%、许可证、股价 -15%)让部分用户选择「等下版或回退 M2.7」。性价比仍是核心吸引力:重度开发者建议直接按量计费、勿死磕 Token Plan;轻中度用户 Plus ¥49(6 亿 token)够日常用。

榜单与实测落差

典型「分数高、体感落差」:官方 SWE-Bench Pro 59.0% 逼近 GPT-5.5,实测却有 ARC-AGI-2 个位数、编程语法错误频发、扑克模拟烧 30-40 分钟 token 未通过;andlukyane 的真机修复虽快(测试 188→237)但 Opus 复核发现 2 个被自身测试掩盖的 critical 回归——「让 M3 同时写测试和修代码」会放大自证偏差。根因是执行型任务强、抽象推理与稳定性弱,且所有分数为 vendor-run 自评需打折看(钛媒体还指出评测用 Claude Code 作脚手架);cache_read 膨胀 bug(Issue #25)进一步放大实测成本。

数据来源

本页由仓库 content/models/minimax-m3.md 初始化。后续修订通过公开审核队列发布。