模型:Qwen3
| 名称 | Qwen3 |
|---|---|
| 厂商 | 阿里巴巴通义千问(Alibaba Qwen) |
| 发布日期 | 2025-04-29 |
| 上下文 | 256k |
| 最大输出 | |
| 价格 | $0.15/$1.5 |
| 定位 | 开源王座 |
一句话点评
开源王座五项全场最优登顶,数学代码双双问鼎、四张 H20 就能跑满血;过度思考与审查是绕不开的暗面,Agent 编排仍欠火候。
社区反馈 · 编程
社区评价两极但偏正面。Aider 官方基准页(2025-05-08)记录 235B whole + VLLM bf16 + /no_think 65.3%,但 pass_rate_1 仅 28.0%——首答弱、改对强;Wolfram 用 Q4 量化复现 JS+Python 子集 69.9% 证实「同区间属实」。InfoQ 实测:复杂代码陷阱题 Qwen3 44s 完答、R1 要 80s,且「DeepSeek 认为 Qwen3 的代码结果细节上更优」。用户称 C 嵌入式结对编程「约等于 R1 甚至略好」;HN 用户 storus 用 Qwen3-Coder 经 Claude Code 驱动,已「replaced my full-stack use of Opus 4.6,错误率仅略高」。落差点:BFCL v3 70.8 分数高但 Agent 体感不如闭源旗舰,OpenHands 实测 235B 100-turn Pass@1 45.2%、RFT 微调后才到 59.9%。
社区反馈 · 推理
数学/逻辑推理是最受认可的强项:Thinking-2507 AIME25 92.3(初版 81.5 提升 11 个百分点)、HMMT25 83.9 超 Gemini-2.5-Pro 82.5。但 overthinking 有名人实证:Simon Willison 测 pelican SVG 时 Thinking-2507「thought for 166 seconds——我从未见过模型想这么久」;4B-Thinking-2507 对一句 hi 可烧到 10,000 token(hybrid 版 1,000 上限),Ollama 默认 num_ctx=4096 下连 system prompt 都读不到。技术报告(arXiv:2505.09388)自承通用 RL 后 AIME24/LiveCodeBench 思考模式反降;社区实测 DeepSearch 场景 235B-Thinking 约等于 DeepSeek-V3 水平。
社区反馈 · 中文
中文创作与理解是 Qwen 系列一贯强项:WritingBench 88.3 全场最优、Creative Writing v3 86.1,119 种语言覆盖;量子位/界面/澎湃/InfoQ 中文媒体矩阵首发即铺满「开源王座」叙事,4×H20 部署成本「仅为 DeepSeek-R1 三分之一」成中文社区传播金句。但审查导致中文政治类话题体验打折:China Media Project 用 thought token forcing 实测,Qwen3 对涉华问题的英文回答被系统导向正面叙事;ChinaBench 量化 qwen3-next-80b 仅 33% 合规,Uyghur 类目 0% 合规。
升级共识
2507 迭代整体值得升级:Instruct-2507 登顶 Chatbot Arena 全球第三(开源首次)、Thinking-2507 在 17 项基准领先、上下文翻倍至 256K——「开源模型首次稳定逼近闭源旗舰」。但 overthinking 未根除且思考量翻倍(1,000 → 10,000 token 量级):日常简单任务建议直接用 Instruct-2507 或 /no_think,Agent 场景务必给足 max_tokens 预算,等后续版本修好过度思考再全面切换 Thinking。
榜单与实测落差
主流反馈「分数高体感也高」:编程/数学体感接近 R1,Aider 65.3% 与 Wolfram 69.9% 复现吻合,InfoQ 实测还快于 R1(44s vs 80s);但落差点同样明显——pass_rate_1 仅 28.0% 意味着首答弱、全靠「改对」,过度思考让简单问题也走长推理链(4B 对 hi 烧 10k token),Instruct-2507 仍藏思考 token;Agent 维度 BFCL 70.8 分数高,OpenHands 实测 235B 裸跑 45.2% Pass@1,体感确实不如闭源顺手。根因是「思考模式无差别发力」+「instruct 审查注入」+「Agent 编排欠成熟」;缓解:日常用 Instruct-2507、/no_think、Cerebras 1400-1500 tok/s 兜底速度、RFT 微调补 Agent 短板。
数据来源
本页由仓库 content/models/qwen3.md 初始化。后续修订通过公开审核队列发布。