模型:Kimi K3
| 名称 | Kimi K3 |
|---|---|
| 厂商 | 月之暗面(Moonshot AI) |
| 发布日期 | 2026-05-28 |
| 上下文 | 2M |
| 最大输出 | 64000 |
| 价格 | $2/$10 |
| 定位 | 长文档与中文特化 |
一句话点评
2M 长文与中文文档理解稳定,适合知识密集型任务。
社区反馈 · 编程
前端代码是最大亮点:Arena #1(1679 分)、76% 盲测胜率、one-shot 生成 macOS 应用被赞「giga gapped fable and sol on code frontend」;开发者 Stephen Bochinski 与 Claude 双跑实测「for all practical purposes I can't tell them apart. Same tasks, same quality of output, and near identical token counts」。但 harness 横评(swelljoe 的 flar 项目)给 K3 评 C+:$19 订阅一个 5 小时窗口烧掉 94%、周用量烧掉 19%,「alarmingly inefficient/expensive」,不过 07-22 官方降温后「K3 got a lot faster」,且用它做安全审计「found some good problems」;OpenCode 直连实测约 $5/小时、每小时吃 10M token(HN 热评),真实 OSS 项目三模型分工中 K3 负责审查/重构、全项目总成本约 $8。AI Stack 自托管实测任务解决率 86.4%(比 GLM-5.2/Opus 4.8 高 24pp),但复杂工程化 SWE 仍落后——FrontierSWE 81.2% 低于 Fable 5 重算的 86.6%,且均为厂商用 Kimi Code harness 自测,SWE-bench Verified 等独立榜单尚未收录 K3。
社区反馈 · 推理
综合推理 AA 57 分低于 Fable 5 的 60 分,HLE 亦落后;物理仿真倒水测试首次翻车(水粒子穿杯壁+杯底漏水),经提醒才改正且「改得也很慢」;开发者 Theo 实测 K3 思考更久、输出更多、重复尝试更多,单任务总成本可能接近 GPT-5.6 Sol 且速度更慢;AI Stack 量化了这一差距——K3 比 Claude Code 基线慢约 8 倍(任务中位时长 38 vs 26 分钟)。独立评测 Alex Inch 直言「K3 isn't cheap」:AA Intelligence Index 上每任务成本仅略低于 OpenAI 旗舰,却是 GLM-5.2 的 2 倍、DeepSeek V4 的约 20 倍。但正面声音同样存在:社区实测「extremely good at troubleshooting」「K3 fixed it in a minutes」,另有用户称「K3 is as good as Fable」;方差论者则认为「closing in on Opus and GPT, but incredibly inconsistent」。
社区反馈 · 中文
作为国产模型中文是默认优势,知乎/36氪/钛媒体等中文媒体报道中表达流畅自然,中文创作理解无需担忧,无明显负面反馈;中文社区的主要不满集中在定价(知乎实测从 DeepSeek 换 K3 消费翻 17.3 倍),而非中文能力本身。
升级共识
前端代码与企业级 API 场景值得升级(Arena #1、企业称「steal」、AI Stack 任务解决率 86.4%);个人高频使用与成本敏感场景建议等待——$15/M 输出定价劝退、官方 Vivace 档被实测「close to 2x slower than Opus on Max reasoning」(HN 热评),swelljoe 实测 $19 订阅 5 小时窗口烧掉 94%,可留 K2.6 或等开源生态成熟后再上手。
榜单与实测落差
典型「分数高、体感差」:榜单前端 #1 但实测物理仿真翻车、推理「慢得着急」、AI Stack 量化比 Claude Code 基线慢约 8 倍;Reddit 称「isn't quite better than Fable yet, but getting closer」;独立评测称「not cheap」(AA 每任务成本≈OpenAI 旗舰、为 GLM-5.2 的 2 倍)。根因是前端生成强但综合推理/物理仿真/安全落后 SOTA 闭源,且大量分数为厂商自测非独立验证,速度慢进一步拉大落差。
数据来源
本页由仓库 content/models/kimi-k3.md 初始化。后续修订通过公开审核队列发布。