跳转到内容

模型:Qwen3.7-Max

来自封神榜 Wiki
名称 Qwen3.7-Max
厂商 阿里巴巴 Qwen 团队(通义实验室)
发布日期 2026-05-20
上下文 1M
最大输出 131072
价格 $2.5/$7.5
定位 Agent 马拉松

qwen3-7-maxqwen80.4Agent、数学、低幻觉

模型content/models/qwen3-7-max.md

一句话点评

35 小时零中断自主 Agent 马拉松登顶国产旗舰,SWE 与 Opus-4.6 持平、非幻觉率 SOTA;代价是全线闭源与 token 效率,开源派在等 3.8。

社区反馈 · 编程

基准全面领跑:SWE-Pro 60.6% 同 scaffold 第一、SWE-Verified 80.4 与 Opus-4.6(80.8) 统计持平、Terminal Bench 69.7 超 DS-V4-Pro 67.9、HLE 41.4 超 Opus-4.6 的 40.0、AA codingindex 50.1 紧咬 GLM-5.2 的 50.7(HN 用户 kristopolous 脚本实测)。实测分歧明显——Atlas Cloud 10 个真实 bug 修复中 Plus 10/10 全过而 Max 仅 9/10;TRAE 官方社区 JasonShane 5/22 实测同项目同提示词复现「优秀」、vs GLM-5.1「略胜一筹」(单次测试自注偏差);HN 用户 abalashov 称在 DeepSeek-V4-Pro/Kimi K2.6/Qwen3.7 Max 之间数月编程不再用 Claude;但 V2EX 用户在 Qoder 0.2 倍积分下试中等难度需求「基本满意」、对复杂需求观望「怕会有隐藏 bug」,HN 用户 betimsl 更实测吐槽「qwen agent 工具调用几乎总是失败」。

社区反馈 · 推理

核心卖点:GPQA Diamond 92.4 全球第 7、HLE 41.4 超 Claude Opus-4.6(40.0)、AIME 2025 15 题中 14 题正确;但 Plus 同样答对 14 题且每题仅 113s vs Max 303s(快 2.68 倍),旗舰溢价在推理性价比上被质疑;折纸等复杂逻辑推演中 Max 推理连贯性与抗干扰性略强,被质疑后仍能坚持正确结论;302.AI 实测称相比 Qwen3.6-Plus「逻辑推理更具动态构造性」。

社区反馈 · 中文

中文-英文理解与复杂指令跟随在 3.x 系列持续提升,官方强调 multilingualism 为强项;中文社区(知乎/量子位/掘金/TRAE 论坛)评价正面但关注点更多在开源策略而非能力本身;知乎评测称「对比御三家还是有点差距」但承认 Agent 案例确实有惊喜,302.AI 认可中文代码注释与文档生成质量;成本焦虑是中文社区另一主线——掘金「托尼不是塔克」测后称「有点用不起」,CSDN 整理用户吐槽「烧钱如流水的 Experts 专家团模式,一小时积分就干没了」。

升级共识

技术能力派认可 Agent 长程执行与编程基准进步、值得尝试(abalashov「数月编程不再用 Claude」是极端正面样本);开源信仰派与成本敏感派「等开源版 / 等下版」——Atlas Cloud 实测 Plus 在真实 bug 修复 10/10 vs Max 9/10、AIME 持平且快 2.68 倍,旗舰溢价不显著;TRAE 官方社区单次实测 vs GLM-5.1 仅「略胜一筹」,体感高度依赖场景与立场,r/LocalLLaMA 564 票闭源帖与「国产新模王」报道并存。

榜单与实测落差

「分数高、体感分化」:SWE-Pro 同 scaffold 第一、HLE 41.4、AA codingindex 50.1 均亮眼,但 Atlas Cloud 实测 Plus 真实 bug 修复 10/10 vs Max 9/10、AIME 持平且快 2.68 倍,Honest Review 发现 Web 开发任务 Phase 2 整段遗漏,TRAE 单次实测 vs GLM-5.1 仅「略胜一筹」,betimsl 更实测吐槽工具调用「几乎总是失败」;根因是自家 scaffold + 选择性对比(只对比 Opus-4.6)+ token 效率差(girvo 核心疑问)+ 闭源无从复现验证;缓解:真实场景先小样验证、复杂需求观望、等开源版再迁移。

数据来源

本页由仓库 content/models/qwen3-7-max.md 初始化。后续修订通过公开审核队列发布。