模型:Kimi K2.6
| 名称 | Kimi K2.6 |
|---|---|
| 厂商 | 月之暗面 / Moonshot AI |
| 发布日期 | 2026-04-20 |
| 上下文 | 256K |
| 最大输出 | |
| 价格 | $0.95/$4 |
| 定位 | 开源编程偏科王 |
一句话点评
开源编程偏科王:SWE Pro 58.6 开源 SOTA、盲测全球第一;代价是推理无限否定、输出冗长,按场景选型。
社区反馈 · 编程
最受好评维度,多条实测背书:SWE-Bench Pro 58.6 开源 SOTA、盲测挑战赛 22 分 7-1-0 全球第一(HN 380 分/219 评论);30 天全职实测(Manu Nayyar R)称 SWE-Bench Verified 80.2 vs Opus 4.6 80.8「0.6 分差距不值 8 倍差价」,第 4 天取消 Claude 订阅、第 12 天弃用 Copilot;Joe Njenga 用 Ollama Cloud 一条命令接入 Claude Code,React+Tailwind 项目「CRUD 一次跑通、组件结构干净、Tailwind 风格一致」。也有保留:Reddit A/B 测试者称「still nowhere near opus or gpt 5.4」,知乎将其定位在 Sonnet 4.6 水平;LinkedIn 3 周 A/B 实测(Ayaz Sharif)发现约 30 个文件后 Kimi 上下文管理开始吃紧、跨服务 gRPC 依赖会跟丢(漏读 Python protobuf 定义);mighty turtle 帖反馈「really thinks a lot,频繁 /compact」。
社区反馈 · 推理
最大争议点:V2EX OP 帖(20 回复)直斥「无限否定自己」「堪比 qwq-32b」,用户 codele 反馈「一个小问题循环了十几分钟」;知乎承认长链推理较 K2.5 改善、解空间探索更充分,但代价是思考效率极低——复杂题 token 消耗可达竞品 3-6 倍,AA 实测 Intelligence Index 烧掉 170M output tokens(中位数仅 99M、GPT-5.4 为 110M),Ethan Mollick Lem Test 74 页思维链仅得「okay-ish」;HN nikcub 直言「below sonnet and opus 4.0 on capability」。BenchLM 知识维度仅 13th 百分位,「偏科生」成最普遍定位;Simon Willison 测 K3 时反衬「K3 较 K2.6 输出 token 少 21%」——K2.6 的冗余是实打实的短板。
社区反馈 · 中文
中文为国产模型基础能力,无显著负面;前端生成审美被中文社区认可(蓝戒博客称「和 3 万块的设计师稿子几乎是同一个水平」,V2EX beyondstars 称「kimi 做前端感觉审美还不错的」);知乎/V2EX 中文技术讨论流畅,V2EX laoyutang「编码能力可以,基本一次能写对」;未见中文能力专项缺陷反馈。
升级共识
编程与 Agent 场景值得升级——SWE Pro 58.6 开源 SOTA、长程编码 13h 不崩、API 仅为 Opus 4.7 的 1/8,HN DeathArrow 实测「coding 20x cheaper」、30 天实测者「0.6 分差距不值 8 倍差价」;但推理/知识场景建议等下版或继续用 GLM 5.1(知乎「偏科生」定位、BenchLM 知识 13th 百分位),复杂推理宁可切 Opus 4.7——按场景选型而非全面替换。
榜单与实测落差
「分数高但体感差」集中在推理:SWE-Bench Pro 58.6 开源 SOTA、盲测全球第一、Terminal-Bench 66.7 超 GPT-5.4,但 AIME/GPQA 与头部差 2-4 分、HLE 无工具版仅 34.7%、AA 实测推理烧 170M output tokens(中位数 99M)、复杂题 token 消耗达竞品 3-6 倍。根因是长链思考探索充分但收敛效率差,「无限否定」加剧体感恶化(V2EX defaw/codele 实测循环十几分钟);HN 视角认为盲测第一有赛制因素(只参加最后 5 场)。编程/Agent 场景放心用,推理场景换 GLM 5.1 或等 K3。
数据来源
本页由仓库 content/models/kimi-k2-6.md 初始化。后续修订通过公开审核队列发布。