模型:Qwen3-Coder
| 名称 | Qwen3-Coder |
|---|---|
| 厂商 | 阿里巴巴通义千问(Alibaba Qwen) |
| 发布日期 | 2025-07-22 |
| 上下文 | 128k |
| 最大输出 | 32000 |
| 价格 | $0.4/$1.6 |
| 定位 | 开源代码特化 |
模型content/models/qwen3-coder.md
一句话点评
低成本开源代码模型,日常开发足够可靠。
社区反馈 · 编程
开源 Agentic 编程天花板共识扎实:SWE-bench 66.5% + Terminal-Bench 37.5% 超 Sonnet 4 + 三榜开源 SOTA,HN 发布帖 765 分、Reddit 1.9K 赞一片叫好;「Is Qwen3-coder the best kept secret out there?」成 r/LocalLLaMA 热帖。但分歧同样尖锐:初版 480B 工具调用 bug(发布数日官方公告需重下载)、QwenCode/llama.cpp 工具支持未就绪、知乎雨飞「循环烧钱」(单帖实测成本失控)、V2EX 免费额度「8 月中各种截断报错」;本地用户甚至分化——「30B-Coder 有点 agentic 过拟合,通用 30B-A3B-2507 更好用」成为 r/LocalLLaMA 高赞。
社区反馈 · 推理
设计重点不是通用推理而是代码推理:CRUXEval 92.13、MultiPL-E 88.00 是强项;但模型是 Instruct 非思考系(无 effort 档位),LiveCodeBench v6 仅 44.93、Codeforces 1800,均低于同门 Qwen3-235B-Thinking(74.1 / 2134)——「代码特化、通用推理让位」是社区共识;Next 版以 3B 激活做到 SWE-bench Verified 70.6(arXiv 2603.00729),印证「小激活 + Agent RL」路线在 agentic 推理上的有效性。
社区反馈 · 中文
中文社区热度是系列之最:知乎问题被浏览 41.2 万+、152 个回答(2026-08-10 快照),「编程能力比肩 Claude 4」成高赞共识;FullStackBench-zh 63.07 高于英文 62.54,中文全栈任务实测有优势;「Claude Code / Gemini CLI 国产平替」成中文社区主流叙事(CSDN/掘金同源转述);中文专项负面反馈较少,工具循环与限速属通用问题而非中文特有问题。
升级共识
Agentic 编程/长程重构场景值得立即升级:SWE-bench 66.5% 开源第一梯队、Terminal-Bench 37.5% 超 Sonnet 4、官方 Claude Code proxy 直通,storus 实测已取代 Opus 4.6 全栈用途;但工具调用循环/初版 bug、免费渠道限速与「agentic 过拟合」(30B-Coder 本地体感不如通用 2507)让通用与本地场景分化——本地用户建议留在 Qwen3-30B-A3B-2507 或直接上 Next(3B 激活 SWE 70.6),API 预算敏感场景用 qwen3-coder-plus 低输出档防循环失控。
榜单与实测落差
官方「开源 SOTA、媲美 Sonnet 4」的榜单叙事与日常体感存在三层落差:① 工具链层——初版 480B 工具调用 bug(发布数日需重下载)、QwenCode/llama.cpp 适配未就绪(1mu3tln)让「agentic 招牌」在真实 harness 里打折扣;② 成本层——知乎雨飞「循环烧钱」、V2EX「各种截断报错」说明免费渠道体验不稳;③ 能力层——agentic 特化挤压通用能力(LCB v6 44.93 vs 同门 235B 74.1),本地 480B Q6 408GB、6×7900XTX 仅 7 tok/s 又给「开源平民」人设泼冷水。根因是「模型强、工具链未适配」+「特化过深」;缓解:官方 proxy + 最新权重、本地选 30B-A3B 或 Next、简单任务切通用 2507。
数据来源
本页由仓库 content/models/qwen3-coder.md 初始化。后续修订通过公开审核队列发布。