跳转到内容

模型:Qwen3-Coder

来自封神榜 Wiki
名称 Qwen3-Coder
厂商 阿里巴巴通义千问(Alibaba Qwen)
发布日期 2025-07-22
上下文 128k
最大输出 32000
价格 $0.4/$1.6
定位 开源代码特化

qwen3-coderqwen66.2代码、开源、平民

模型content/models/qwen3-coder.md

一句话点评

低成本开源代码模型,日常开发足够可靠。

社区反馈 · 编程

开源 Agentic 编程天花板共识扎实:SWE-bench 66.5% + Terminal-Bench 37.5% 超 Sonnet 4 + 三榜开源 SOTA,HN 发布帖 765 分、Reddit 1.9K 赞一片叫好;「Is Qwen3-coder the best kept secret out there?」成 r/LocalLLaMA 热帖。但分歧同样尖锐:初版 480B 工具调用 bug(发布数日官方公告需重下载)、QwenCode/llama.cpp 工具支持未就绪、知乎雨飞「循环烧钱」(单帖实测成本失控)、V2EX 免费额度「8 月中各种截断报错」;本地用户甚至分化——「30B-Coder 有点 agentic 过拟合,通用 30B-A3B-2507 更好用」成为 r/LocalLLaMA 高赞。

社区反馈 · 推理

设计重点不是通用推理而是代码推理:CRUXEval 92.13、MultiPL-E 88.00 是强项;但模型是 Instruct 非思考系(无 effort 档位),LiveCodeBench v6 仅 44.93、Codeforces 1800,均低于同门 Qwen3-235B-Thinking(74.1 / 2134)——「代码特化、通用推理让位」是社区共识;Next 版以 3B 激活做到 SWE-bench Verified 70.6(arXiv 2603.00729),印证「小激活 + Agent RL」路线在 agentic 推理上的有效性。

社区反馈 · 中文

中文社区热度是系列之最:知乎问题被浏览 41.2 万+、152 个回答(2026-08-10 快照),「编程能力比肩 Claude 4」成高赞共识;FullStackBench-zh 63.07 高于英文 62.54,中文全栈任务实测有优势;「Claude Code / Gemini CLI 国产平替」成中文社区主流叙事(CSDN/掘金同源转述);中文专项负面反馈较少,工具循环与限速属通用问题而非中文特有问题。

升级共识

Agentic 编程/长程重构场景值得立即升级:SWE-bench 66.5% 开源第一梯队、Terminal-Bench 37.5% 超 Sonnet 4、官方 Claude Code proxy 直通,storus 实测已取代 Opus 4.6 全栈用途;但工具调用循环/初版 bug、免费渠道限速与「agentic 过拟合」(30B-Coder 本地体感不如通用 2507)让通用与本地场景分化——本地用户建议留在 Qwen3-30B-A3B-2507 或直接上 Next(3B 激活 SWE 70.6),API 预算敏感场景用 qwen3-coder-plus 低输出档防循环失控。

榜单与实测落差

官方「开源 SOTA、媲美 Sonnet 4」的榜单叙事与日常体感存在三层落差:① 工具链层——初版 480B 工具调用 bug(发布数日需重下载)、QwenCode/llama.cpp 适配未就绪(1mu3tln)让「agentic 招牌」在真实 harness 里打折扣;② 成本层——知乎雨飞「循环烧钱」、V2EX「各种截断报错」说明免费渠道体验不稳;③ 能力层——agentic 特化挤压通用能力(LCB v6 44.93 vs 同门 235B 74.1),本地 480B Q6 408GB、6×7900XTX 仅 7 tok/s 又给「开源平民」人设泼冷水。根因是「模型强、工具链未适配」+「特化过深」;缓解:官方 proxy + 最新权重、本地选 30B-A3B 或 Next、简单任务切通用 2507。

数据来源

本页由仓库 content/models/qwen3-coder.md 初始化。后续修订通过公开审核队列发布。