DeepSeek 的故事从架构选择开始。但 Kimi 的故事,从一个产品开始。
2023 年 10 月,一家叫月之暗面的公司上线了一个对话产品——Kimi Chat。它当时最引人注目的特点只有一个:超长文本。第一批用户就支持 200K 上下文,是当时国产产品里最长的。你可以直接把一本小说丢进去,让它总结、分析、提问。
这个策略奏效了。Kimi Chat 的用户口碑迅速爆发,成为国产对话产品中体验最流畅、长文本处理最自然的之一。但产品成功的背后,技术团队在做一件更大的事。
2025 年 1 月,就在 DeepSeek 发布 R1 的同一个月,月之暗面放出了 K1.5 的技术报告。
标题很学术:Scaling Reinforcement Learning with LLMs。但结果一点也不学术——K1.5 是第一个非 OpenAI 阵营追平 o1 满血版的模型。
它怎么做到的?三个关键创新:
第一是 128K 的 RL 上下文——当时所有做推理 RL 的人,上下文都限制在几千 token。K1.5 发现,上下文越长,推理能力越强。长到 128K 时,模型自己学会了规划、反思、纠错。不需要 Monte Carlo 搜索,不需要价值函数,不需要过程奖励模型。上下文本身就够了。
第二是 long2short——把长思维链的推理能力压缩到短输出里,让模型既会深入思考,也会快速回答。
第三是 多模态——K1.5 同时训练文本和视觉,是第一个达到 o1 水平的多模态推理模型。
训练大模型,全行业都用一个优化器:AdamW。它稳定、可靠、人人都会用。但有个问题——它不是 token 效率最高的。
2025 年 2 月,月之暗面发了另一篇论文:Muon is Scalable for LLM Training,也就是 Moonlight 项目。他们用 Muon 优化器训练了一个 3B 模型,发现达到同样的损失,Muon 只需要 AdamW 大约一半的 token。
但 Muon 有个缺点——在大规模训练中,注意力 logit 会爆炸,导致训练崩溃。这个问题到 Kimi K2 时才被真正解决(MuonClip,后面会讲)。
Moonlight 的贡献是:验证了 Muon 在 LLM 训练中的可行性,为后续 K2 的大规模训练铺了路。
K1.5 展示了 Kimi 的模型能力。但模型再强,跑不起来也白搭。
2025 年 2 月,月之暗面和清华大学合作的 Mooncake 论文,拿下了 FAST 2025 的最佳论文奖。FAST 是存储和文件系统领域的全球顶会。一个做 AI 的公司,在存储顶会上拿了最佳论文——这本身就很说明问题。
Mooncake 的做法是分离——预填充交给算力强的机器,解码交给内存大的机器,中间用一个分布式的 KV 缓存池连起来。这个缓存池不只用 GPU 内存,还把 CPU 内存、SSD、网卡全部用上了。
Mooncake 的核心洞察就一句话:用更便宜的存储换更贵的算力。与其让 GPU 重复计算,不如把算过的结果存下来。这不是一篇"AI 论文",这是一篇"系统论文"。它解决的是 AI 落地中最实际的成本问题。
有了 K1.5 的推理能力、Moonlight 的训练效率、Mooncake 的推理基础设施,K2 的诞生就成了水到渠成的事。
2025 年 4 月,月之暗面发布了 Kimi K2——1.04 万亿参数,326 亿激活,384 个专家,MoE 架构。是目前最大的开源 MoE 模型之一。
K2 最大的创新不是架构本身,而是 MuonClip 优化器。
Moonlight 验证了 Muon 的效率更高,但大规模训练时注意力 logit 会爆炸。K2 的解决方案很巧妙:监控每头注意力的最大值,如果超过阈值就缩放 QK 权重。训练稳定后,这个机制自动关闭。效果是——15.5 万亿 token 的训练,零 loss 尖峰。
但 K2 真正让人印象深刻的是它的Agent 能力。它不只是回答问题,它像 Agent 一样工作:调用工具、编写代码、操作浏览器。为了训练这个能力,月之暗面建了一条大规模的 Agent 数据合成管线——从 GitHub 抓了 3000 多个真实的 MCP 工具,又合成了 20000 多个虚拟工具,让 K2 在各种场景中练习。
Transformer 最核心的问题是注意力机制的二次复杂度。DeepSeek 的答案是 MLA(压缩 KV 缓存)。Kimi 的答案不同——从根本上去掉 KV 缓存。
KDA——Kimi Delta Attention。它的核心是一个通道级的遗忘门。
KDA 把 KV 缓存从 O(T) 变成了 O(1)——不管上下文多长,缓存大小固定。和 MLA 的区别是:MLA 是压缩(4K 照片压 JPEG),KDA 是彻底换方案(不用照片了,改实时画画)。
KDA 和 MLA 代表了两种哲学:MLA 是"保留注意力但压缩",KDA 是"换掉注意力用递推"。国产模型在这条路上走出了两条不同的创新路径。
K2 是纯文本的 Agent。但真实世界不是纯文本的。
2026 年 2 月,月之暗面发布了 K2.5——基于 K2 的多模态版本。
他们在 K2 的基础上加了一个 MoonViT-3D 视觉编码器,用 15 万亿额外的图文 token 做联合预训练。关键发现与直觉相反:早期融合视觉比晚期好,视觉比例 10% 比 50% 好,纯文本 SFT 就能激活视觉能力。视觉和文本在预训练阶段就建立好了连接,不需要专门的数据来解锁。
K2.5 还有一个更重要的创新——Agent Swarm(并行 Agent RL)。它不是让一个模型单线程跑完所有步骤,而是用一个可训练的协调器,把复杂任务拆解成子问题,派发给多个冻结的专用 Agent 并行处理。就像有一个项目经理,把一个大项目拆成多个任务,同时让几个小组一起干。
K2 和 K2.5 是通用模型。但有些任务需要专业选手。
Kimi-Dev 就是这样一个专业选手——专门解决 GitHub Issue。它不追求通用能力,只追求一件事:拿到一个 bug 报告,找到问题,修好它,通过测试。
Kimi-Dev 的创新点是一个很聪明的思路:Agentless Training as Skill Prior.
Kimi-Dev 把修 bug 拆成三个基本功:定位问题、修改代码、写测试。用纯 workflow 的方式(Agentless,不需要 Agent 多轮交互)训练这些能力,然后把这些能力作为起点,再做 Agent 化的训练。
在 K3 发布之前,月之暗面还做了另一件有意思的事。
2026 年 3 月,他们发了篇论文叫 Attention Residuals。讲的是残差连接的替代方案。
Kimi 的 Attention Residuals 提出了一个替代方案:不要简单相加,而是让注意力机制来决定残差路径的权重。每一层不是"输入+计算结果",而是"根据上下文决定输入该留多少、计算结果该加多少"。就像调音师,不是把两路信号简单混合,而是根据曲子风格动态调整每路的音量。
这篇论文有意思的地方不止于技术本身。论文的共同第一作者里,有一位 17 岁的深圳高中生,陈光宇。他加入月之暗面做研究一年,就参与了这项核心架构创新。
马斯克在 X 上转发了这篇论文,评论了两个字:"Impressive work from Kimi"。
2026 年 7 月 16 日,就在这一周,月之暗面发布了 Kimi K3。
2.8 万亿参数。896 个专家,每次激活 16 个。全球最大的开源模型。不是"国产最大",不是"亚洲最大",是全球最大。
K3 的成绩单非常亮眼:Terminal Bench 2.1 得分 88.3,超越 Claude Opus 4.8 的 84.6。Arena.ai 前端编码排行榜全球第一。在编码和 Agent 任务上,K3 已经能和 Claude Fable 5、GPT-5.6 Sol 正面竞争。
Moonshot 还展示了一些惊人的 demo:K3 自主构建了一个 GPU 编译器,48 小时内完成了一个芯片设计,2 小时复现了一个计算天体物理学的完整管线——研究人员说这些任务通常需要一到两周。
K3 的意义不只是更大。它证明了一件事:KDA 线性注意力架构 + Muon 优化器 + Mooncake 推理引擎,这条全栈自研的路线,真的走到了全球前沿。从 K1.5 追平 o1,到 K2 开源 Agent 第一,到 K3 成为全球最大开源模型——月之暗面用了不到两年。
回头看 Kimi 的进化路径,和 DeepSeek 完全不同。
DeepSeek 是架构驱动——MoE → MLA → FP8 → GRPO → CSA/HCA,每一步都是架构上的原创。Kimi 是系统驱动——从产品出发,反推技术需求,在每个层面都有原创贡献:
DeepSeek 的故事告诉我们:架构选择的累积效应。Kimi 的故事告诉我们:系统级创新的力量——从内核到推理引擎到模型架构到 Agent 框架,全栈自研。
2023 年的 Kimi Chat 只是一个长文本聊天产品。三年后,月之暗面拥有了自己的优化器、自己的推理引擎、自己的注意力架构、自己的多模态模型、自己的 Agent 框架。这条路走得不快,但每一步都踩实了。
这,就是 Kimi 的故事。从月之暗面,到 AI 世界的正中央。
[1] Kimi K1.5 — Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599.
[2] Moonlight / Muon — Kimi Team (2025). Muon is Scalable for LLM Training. arXiv:2502.16982.
[3] Mooncake — Qin et al. (2025). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. FAST 2025 Best Paper.
[4] Kimi K2 — Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534.
[5] KDA / Kimi Linear — Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692.
[6] Kimi K2.5 — Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276.
[7] Kimi-Dev — Yang et al. (2025). Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents. arXiv:2509.23045.
[8] Attention Residuals — Kimi Team (2026). Attention Residuals: Rethinking Deep Directional Aggregation. arXiv:2603.15031. 马斯克点赞.
[9] KDA paper note — 深度精读. 论文笔记 #28.
[10] AttnRes paper note — 深度精读. 论文笔记 #26.