跳转到内容

模型:Kimi K2

来自封神榜 Wiki
名称 Kimi K2
厂商 Moonshot AI / 月之暗面
发布日期 2025-07-11
上下文 128K
最大输出
价格 $0.55/$2.2
定位 开源编程破局

kimi-k2kimi65.8开源、编程、Agent

模型content/models/kimi-k2.md

一句话点评

开源破局的万亿 MoE:编程双料 SOTA 逼近闭源第一梯队,白菜价与 MIT 自由吸粉;幻觉与长上下文不稳是硬伤。

社区反馈 · 编程

最大亮点:SWE-bench Verified 65.8% 开源 SOTA,代码能力落位 Claude 3.7~4.0 之间、略好于 DeepSeek R1;Cline 一周生产数据显示 diff 编辑失败率仅 3.3%,匹配甚至偶尔超过 Claude 4 Sonnet。Linux.do 真实 go 项目实测(1.5 万行、1/3 重构)跑满 100M+ tokens、900+ 请求、总花费不到 ¥50,近乎零手写代码完成,工具调用(Read/Write/Update/Bash/Grep)全程零故障。但落差同样明显:V2EX 用 Claude Code 跑 PHP 项目,第一版架构惊喜、review 时幻觉爆炸——导入不存在的类、方法参数错误、调用不存在的方法,花费 ¥15 仍无法进入逻辑验证;单测生成「很少能一遍过」;前端 UI 生成审美偏弱(创作文风强是另一回事,见下)。

社区反馈 · 推理

数学推理是设计重点:K2 Thinking 在 SWE-bench 官方榜超越 Minimax 2.4pt(12 个任务实例)登顶开源第一,用户对比 GPT-5 Thinking 以 45:38 胜出;HLE 44.9%、BrowseComp 60.2% 一度压过闭源。但复杂推理场景仍有幻觉,LessWrong 记录其编造「与同事做的实验」;Superlinear Academy 评测指出它「擅长采集与汇编,不擅长提炼高层洞察」——更像顶级信息采集员而非分析师,非 reasoning 模型思考深度受限。

社区反馈 · 中文

中文理解与创作自然流畅,知乎/V2EX 讨论热烈,「Claude 国产平替」成中文社区主流叙事;EQ-Bench Creative Writing v3 登顶(超越 o3 与 Claude Opus,Nature 亦援引)证明其中文与英文创作文风都强。需区分:创作文风强 ≠ 前端 UI 审美强——后者初版偏弱(K2.5 才重点卷、K2.6 才「摸到第一梯队」);深度中文创作在审美层面仍略逊 Claude 系。

升级共识

编程与 Agent 场景值得立即升级:SWE 65.8% 开源 SOTA、API 白菜价(同任务 $0.53 vs Claude $5,约 1/10)、MIT 系许可自由部署——Linux.do 真实 go 项目不到 ¥50 完成 1/3 重构是「值得」的最硬证据。但两个前置条件:一、免费额度并发 1 基本不可用,须累计充值 ¥50 解锁并发 50 才丝滑;二、幻觉高发场景(事实引用、PHP 等弱类型语言)需人工复核,长上下文任务受 128K 窗口限制。部分用户认为 0905 及后续迭代更好,追新可等 K2 Thinking(SWE 71.3%)。

榜单与实测落差

「分数高但体感两极」:SWE-bench 65.8% 看着很高,真实工作流里 Cline 实测 diff 失败率低至 3.3%(匹配 Sonnet 4),但 V2EX 用 Claude Code 跑 PHP 却「¥15 进不了逻辑验证」——上限高、下限低,稳定性是 MoE 通病。速度是最大落差来源:榜单不测 t/s,而 10~15 tok/s 的实测让「单文件修改 200~300s、多文件重构 800s+」成为 Linux.do 实测帖的主线吐槽。另一面性价比超预期:同 token 量 $0.53 vs $5(dev.to)、$10-20 vs ¥50(Thoughtworks),「best bang for buck」共识稳。落差本质是「模型强、生态未适配」:Claude Code 为 Claude 定制,K2 接进去「像讲着带不同口音的同一语言」(Superlinear)。

数据来源

本页由仓库 content/models/kimi-k2.md 初始化。后续修订通过公开审核队列发布。