模型:Kimi K2
| 名称 | Kimi K2 |
|---|---|
| 厂商 | Moonshot AI / 月之暗面 |
| 发布日期 | 2025-07-11 |
| 上下文 | 128K |
| 最大输出 | |
| 价格 | $0.55/$2.2 |
| 定位 | 开源编程破局 |
一句话点评
开源破局的万亿 MoE:编程双料 SOTA 逼近闭源第一梯队,白菜价与 MIT 自由吸粉;幻觉与长上下文不稳是硬伤。
社区反馈 · 编程
最大亮点:SWE-bench Verified 65.8% 开源 SOTA,代码能力落位 Claude 3.7~4.0 之间、略好于 DeepSeek R1;Cline 一周生产数据显示 diff 编辑失败率仅 3.3%,匹配甚至偶尔超过 Claude 4 Sonnet。Linux.do 真实 go 项目实测(1.5 万行、1/3 重构)跑满 100M+ tokens、900+ 请求、总花费不到 ¥50,近乎零手写代码完成,工具调用(Read/Write/Update/Bash/Grep)全程零故障。但落差同样明显:V2EX 用 Claude Code 跑 PHP 项目,第一版架构惊喜、review 时幻觉爆炸——导入不存在的类、方法参数错误、调用不存在的方法,花费 ¥15 仍无法进入逻辑验证;单测生成「很少能一遍过」;前端 UI 生成审美偏弱(创作文风强是另一回事,见下)。
社区反馈 · 推理
数学推理是设计重点:K2 Thinking 在 SWE-bench 官方榜超越 Minimax 2.4pt(12 个任务实例)登顶开源第一,用户对比 GPT-5 Thinking 以 45:38 胜出;HLE 44.9%、BrowseComp 60.2% 一度压过闭源。但复杂推理场景仍有幻觉,LessWrong 记录其编造「与同事做的实验」;Superlinear Academy 评测指出它「擅长采集与汇编,不擅长提炼高层洞察」——更像顶级信息采集员而非分析师,非 reasoning 模型思考深度受限。
社区反馈 · 中文
中文理解与创作自然流畅,知乎/V2EX 讨论热烈,「Claude 国产平替」成中文社区主流叙事;EQ-Bench Creative Writing v3 登顶(超越 o3 与 Claude Opus,Nature 亦援引)证明其中文与英文创作文风都强。需区分:创作文风强 ≠ 前端 UI 审美强——后者初版偏弱(K2.5 才重点卷、K2.6 才「摸到第一梯队」);深度中文创作在审美层面仍略逊 Claude 系。
升级共识
编程与 Agent 场景值得立即升级:SWE 65.8% 开源 SOTA、API 白菜价(同任务 $0.53 vs Claude $5,约 1/10)、MIT 系许可自由部署——Linux.do 真实 go 项目不到 ¥50 完成 1/3 重构是「值得」的最硬证据。但两个前置条件:一、免费额度并发 1 基本不可用,须累计充值 ¥50 解锁并发 50 才丝滑;二、幻觉高发场景(事实引用、PHP 等弱类型语言)需人工复核,长上下文任务受 128K 窗口限制。部分用户认为 0905 及后续迭代更好,追新可等 K2 Thinking(SWE 71.3%)。
榜单与实测落差
「分数高但体感两极」:SWE-bench 65.8% 看着很高,真实工作流里 Cline 实测 diff 失败率低至 3.3%(匹配 Sonnet 4),但 V2EX 用 Claude Code 跑 PHP 却「¥15 进不了逻辑验证」——上限高、下限低,稳定性是 MoE 通病。速度是最大落差来源:榜单不测 t/s,而 10~15 tok/s 的实测让「单文件修改 200~300s、多文件重构 800s+」成为 Linux.do 实测帖的主线吐槽。另一面性价比超预期:同 token 量 $0.53 vs $5(dev.to)、$10-20 vs ¥50(Thoughtworks),「best bang for buck」共识稳。落差本质是「模型强、生态未适配」:Claude Code 为 Claude 定制,K2 接进去「像讲着带不同口音的同一语言」(Superlinear)。
数据来源
本页由仓库 content/models/kimi-k2.md 初始化。后续修订通过公开审核队列发布。