跳转到内容

模型:Qwen3-Max

来自封神榜 Wiki
名称 Qwen3-Max
厂商 阿里巴巴集团 Qwen 团队(阿里云)
发布日期 2026-06-25
上下文 256k
最大输出 32000
价格 $1.2/$3.6
定位 开源性价比主力

qwen3-maxqwen72.8性价比、开源、中文

模型content/models/qwen3-max.md

一句话点评

开源系中性价比最高的通用模型,中文能力扎实。

社区反馈 · 编程

整体正面但两极分化:SWE-Bench Verified 69.6 官方称「among the world's top-performing models」,MarkTechPost 独立复核认为略低于 Claude Opus 4 非思考版;量子位实测前端编程「一次成功,无需抽卡」,宣称「编程秒了 Opus4」;但腾讯新闻对 Thinking 预览版直言「建议如果写代码的话,先别碰这个模型了」(指向同门 Coder 系列);Claude Code 搭配实测(2026-01-27)skill 调用链路可用,前端审美「有待加强」。

社区反馈 · 推理

官方口径 Thinking 版 AIME25/HMMT 100%,VentureBeat 独立引 HMMT Feb 25 = 98.0、HLE(w/ search)49.8 赢 GPT-5.2-Thinking 45.5;但知乎深度评测称中位提升「甚至只提了9%」,仅打平 DeepSeek V3.2 推理模式;AA 独立实测 Intelligence Index 40,与 MiniMax M2.1 持平、落后 Kimi K2.5(47);AA-Omniscience -34(知识+幻觉评估)落后所有主要对手——「会想」成立,但全面性与稳定性未达顶级。

社区反馈 · 中文

核心优势之一:官方强调中英文文本理解显著增强,CSDN 称「更懂人话,幻觉更少」,支持 100+ 语言;智东西/量子位中文实测均正面(「几秒完成程序员大半天的工作」);中文创作与理解获社区认可,无明显负面;36氪从商业模式角度称「开源引流、云服务变现」路线存疑,属战略质疑而非模型能力批评。

升级共识

编程与 Agent 任务值得升级(SWE 69.6、Tau2 74.8 实测与榜单一致,Claude Code/OpenRouter 接入路径成熟);追求性价比与本地部署的用户建议等开源版或下版(同门 Qwen3-2507/Coder 系列免费);Thinking 版 ¥24/M(AA 口径 $1.2/$6 起)+ 思维链冗长(单次 86M tokens)、中位仅 9%,「最强但不便宜」,按需启用——日常编码用 Instruct 版、需要深度推理再切 Thinking。

榜单与实测落差

三层落差叠加:① 榜单层——LMArena 文本榜全球第三、SWE 69.6、Tau2 74.8 全线拔尖;② 独立评估层——AA Intelligence Index 仅 24(同类中位 19,AA 模型榜 #28),Thinking 版 40 与 MiniMax M2.1 持平、落后 Kimi K2.5 47,GDPval-AA ELO 1170 落后三甲,AA-Omniscience -34 为同类垫底(幻觉未根除);③ 体感层——Reddit 专帖质疑「benchmarks are favouring Qwen3 max」,知乎实测 Thinking 中位提升仅 9%,腾讯新闻「写代码先别碰」。根因:榜单由官方自测 + 偏好对齐撑起,独立智能评估与真实体感更保守;编程与 Agent 实测基本与榜单一致,落差集中在推理版性价比、复杂推理稳定性与幻觉残留。

数据来源

本页由仓库 content/models/qwen3-max.md 初始化。后续修订通过公开审核队列发布。