Kimi 的崛起

从月之暗面到 AI Agent 前沿——Moonshot AI 如何用三年建起自研技术栈
配音 口语版 · 8分02秒
2023.10
Kimi Chat 上线 — 长文本阅读第一印象
首批支持 200K 上下文的国产对话产品,口碑爆发
2025.01
K1.5 — 非 OpenAI 阵营首个追平 o1 的推理模型
128K RL 上下文 + long2short,AIME 77.5
2025.02
Moonlight — Muon 优化器规模化的证明
Muon 比 AdamW token 效率更高,K2 的底层引擎
2025.02
Mooncake — FAST 2025 最佳论文
KV 缓存分离架构,每天 1000 亿 token
2025.04
K2 — 1T 参数的开源 Agent 模型
384 专家 + MuonClip + 3000 工具,开源 Agent 第一
2025.10
KDA / Kimi Linear — 线性注意力的新范式
KV 缓存减 75%,1M 上下文解码快 6.3 倍
2026.02
K2.5 — 视觉 Agent 智能
MoonViT-3D + Agent Swarm,多模态 Agent 新标杆
2026.03
Attention Residuals — 马斯克点赞的架构创新
替代残差连接,17 岁高中生参与研究,为 K3 铺垫
2026.07
K3 — 2.8T 全球最大开源模型
KDA + AttnRes + 896 专家,超越 Claude Opus 4.8
第一章
一个聊天的起点 Kimi Chat
2023.10

DeepSeek 的故事从架构选择开始。但 Kimi 的故事,从一个产品开始。

2023 年 10 月,一家叫月之暗面的公司上线了一个对话产品——Kimi Chat。它当时最引人注目的特点只有一个:超长文本。第一批用户就支持 200K 上下文,是当时国产产品里最长的。你可以直接把一本小说丢进去,让它总结、分析、提问。

背景
2023 年底,"百模大战"打得最激烈的时候,几乎所有中国 AI 公司都在秀参数、秀榜单。月之暗面选了另一条路——先做产品口碑,再补技术深度。

这个策略奏效了。Kimi Chat 的用户口碑迅速爆发,成为国产对话产品中体验最流畅、长文本处理最自然的之一。但产品成功的背后,技术团队在做一件更大的事。

第二章
追平 o1 的第一人 K1.5
2025.01arXiv:2501.12599

2025 年 1 月,就在 DeepSeek 发布 R1 的同一个月,月之暗面放出了 K1.5 的技术报告。

标题很学术:Scaling Reinforcement Learning with LLMs。但结果一点也不学术——K1.5 是第一个非 OpenAI 阵营追平 o1 满血版的模型。

K1.5 的成绩:AIME 77.5,MATH-500 96.2,Codeforces 94 百分位。和 o1 同一水平线。

它怎么做到的?三个关键创新:

第一是 128K 的 RL 上下文——当时所有做推理 RL 的人,上下文都限制在几千 token。K1.5 发现,上下文越长,推理能力越强。长到 128K 时,模型自己学会了规划、反思、纠错。不需要 Monte Carlo 搜索,不需要价值函数,不需要过程奖励模型。上下文本身就够了。

类比
就像让你做题。如果只给你一行草稿纸,你只能写几步。如果给你十页纸,你就能写满演算过程,中途发现错误可以划掉重来。K1.5 就是给模型足够多的"草稿纸"。

第二是 long2short——把长思维链的推理能力压缩到短输出里,让模型既会深入思考,也会快速回答。

第三是 多模态——K1.5 同时训练文本和视觉,是第一个达到 o1 水平的多模态推理模型。

K1.5 证明了一个事情:不需要搜索、不需要价值函数、不需要 PRM,就能做出顶级推理模型。只需要足够长的上下文窗口和正确的 RL 策略。这个思路,后来 Kimi 整个技术栈都在沿用。
第三章
换一个优化器 Moonlight
2025.02arXiv:2502.16982

训练大模型,全行业都用一个优化器:AdamW。它稳定、可靠、人人都会用。但有个问题——它不是 token 效率最高的

2025 年 2 月,月之暗面发了另一篇论文:Muon is Scalable for LLM Training,也就是 Moonlight 项目。他们用 Muon 优化器训练了一个 3B 模型,发现达到同样的损失,Muon 只需要 AdamW 大约一半的 token

类比
同样一个模型,AdamW 要读 100 本书才能学会的东西,Muon 读 50 本就够了。

但 Muon 有个缺点——在大规模训练中,注意力 logit 会爆炸,导致训练崩溃。这个问题到 Kimi K2 时才被真正解决(MuonClip,后面会讲)。

Moonlight 的贡献是:验证了 Muon 在 LLM 训练中的可行性,为后续 K2 的大规模训练铺了路。

第四章
每天 1000 亿 token 的引擎 Mooncake
2025.02FAST 2025 最佳论文

K1.5 展示了 Kimi 的模型能力。但模型再强,跑不起来也白搭。

2025 年 2 月,月之暗面和清华大学合作的 Mooncake 论文,拿下了 FAST 2025 的最佳论文奖。FAST 是存储和文件系统领域的全球顶会。一个做 AI 的公司,在存储顶会上拿了最佳论文——这本身就很说明问题。

类比
Mooncake 解决了一个很简单的问题:推理太慢了,GPU 太贵了。LLM 推理分两步,预填充吃算力,解码吃内存。传统方案让同一台 GPU 干两件事,两边都干不好。

Mooncake 的做法是分离——预填充交给算力强的机器,解码交给内存大的机器,中间用一个分布式的 KV 缓存池连起来。这个缓存池不只用 GPU 内存,还把 CPU 内存、SSD、网卡全部用上了。

效果:请求处理能力提升 59% 到 498%。每天处理超 1000 亿 token。内存碎片率不到 3%。已开源,被 vLLM、SGLang、LMDeploy 集成。阿里、蚂蚁都在用。

Mooncake 的核心洞察就一句话:用更便宜的存储换更贵的算力。与其让 GPU 重复计算,不如把算过的结果存下来。这不是一篇"AI 论文",这是一篇"系统论文"。它解决的是 AI 落地中最实际的成本问题。

第五章
开源 Agent 的新标杆 Kimi K2
2025.04arXiv:2507.20534

有了 K1.5 的推理能力、Moonlight 的训练效率、Mooncake 的推理基础设施,K2 的诞生就成了水到渠成的事。

2025 年 4 月,月之暗面发布了 Kimi K2——1.04 万亿参数,326 亿激活,384 个专家,MoE 架构。是目前最大的开源 MoE 模型之一。

对比
DeepSeek-V3 是 671B 总参数,37B 激活。K2 是 1.04T 总参数,32.6B 激活。参数更多,但激活更少——更稀疏、更高效。

K2 最大的创新不是架构本身,而是 MuonClip 优化器

Moonlight 验证了 Muon 的效率更高,但大规模训练时注意力 logit 会爆炸。K2 的解决方案很巧妙:监控每头注意力的最大值,如果超过阈值就缩放 QK 权重。训练稳定后,这个机制自动关闭。效果是——15.5 万亿 token 的训练,零 loss 尖峰。

[ 视觉:一个仪表盘示意图,显示 logit 最大值被稳定控制在 100 以下 ]

但 K2 真正让人印象深刻的是它的Agent 能力。它不只是回答问题,它像 Agent 一样工作:调用工具、编写代码、操作浏览器。为了训练这个能力,月之暗面建了一条大规模的 Agent 数据合成管线——从 GitHub 抓了 3000 多个真实的 MCP 工具,又合成了 20000 多个虚拟工具,让 K2 在各种场景中练习。

K2 的成绩: SWE-bench Verified 65.8%(开源第一),Tau2-Bench 66.1%,ACEBench 76.5%,LiveCodeBench 53.7%。 LMSYS Arena 开源模型第一,全球第五(含闭源)。
K2 是"Kimi = Agent"这个定位的起点。不是做一个更好的聊天机器人,而是做一个能自己干活的 AI。
第六章
不同的注意力,同样的结果 KDA
2025.10Kimi Linear · KDA

Transformer 最核心的问题是注意力机制的二次复杂度。DeepSeek 的答案是 MLA(压缩 KV 缓存)。Kimi 的答案不同——从根本上去掉 KV 缓存。

KDA——Kimi Delta Attention。它的核心是一个通道级的遗忘门

类比
传统注意力像记笔记,每看一个新 token 都要回头看历史。KDA 像一个实时更新的摘要——每看一个 token,自动更新记忆状态。记忆是固定的,不随文本变长而变大。

KDA 把 KV 缓存从 O(T) 变成了 O(1)——不管上下文多长,缓存大小固定。和 MLA 的区别是:MLA 是压缩(4K 照片压 JPEG),KDA 是彻底换方案(不用照片了,改实时画画)。

效果:KV 缓存减少 75%。1M 上下文解码速度提升 6.3 倍。KDA:MLA = 3:1 混合架构,首次在公平对比下,线性注意力全面超越完整注意力。

KDA 和 MLA 代表了两种哲学:MLA 是"保留注意力但压缩",KDA 是"换掉注意力用递推"。国产模型在这条路上走出了两条不同的创新路径。

第七章
给 Agent 装上眼睛 K2.5
2026.02arXiv:2602.02276

K2 是纯文本的 Agent。但真实世界不是纯文本的。

2026 年 2 月,月之暗面发布了 K2.5——基于 K2 的多模态版本。

他们在 K2 的基础上加了一个 MoonViT-3D 视觉编码器,用 15 万亿额外的图文 token 做联合预训练。关键发现与直觉相反:早期融合视觉比晚期好,视觉比例 10% 比 50% 好,纯文本 SFT 就能激活视觉能力。视觉和文本在预训练阶段就建立好了连接,不需要专门的数据来解锁。

类比
就像一个人从小同时学中文和英文,两种语言在大脑中自然连接。你不需要专门拿中英对照表来训练他"中文到英文"的能力。

K2.5 还有一个更重要的创新——Agent Swarm(并行 Agent RL)。它不是让一个模型单线程跑完所有步骤,而是用一个可训练的协调器,把复杂任务拆解成子问题,派发给多个冻结的专用 Agent 并行处理。就像有一个项目经理,把一个大项目拆成多个任务,同时让几个小组一起干。

Agent Swarm 效果:速度提升 3-4.5 倍。BrowseComp +17.8%(60.6%→78.4%)。SEAL-0 57.4%(最佳)。K2.5 整体:AIME 2025 96.1%,SWE-bench 76.8%,MMMU-Pro 78.5%,视频理解 86.6%。
第八章
专攻一道题 Kimi-Dev
2025.12arXiv:2509.23045

K2 和 K2.5 是通用模型。但有些任务需要专业选手。

Kimi-Dev 就是这样一个专业选手——专门解决 GitHub Issue。它不追求通用能力,只追求一件事:拿到一个 bug 报告,找到问题,修好它,通过测试。

Kimi-Dev 的创新点是一个很聪明的思路:Agentless Training as Skill Prior.

类比
就像你想成为一个篮球运动员,不是直接去打正式比赛,而是先练基本功——运球、投篮、传球。这些基本功就是"skill prior"。练好了再上场比赛,事半功倍。

Kimi-Dev 把修 bug 拆成三个基本功:定位问题、修改代码、写测试。用纯 workflow 的方式(Agentless,不需要 Agent 多轮交互)训练这些能力,然后把这些能力作为起点,再做 Agent 化的训练。

结果:SWE-bench Verified 60.4%(72B 参数,纯 workflow),在所有 workflow 类方法中最高。把经验迁移到 SWE-Agent 后,训练数据效率提升了 32 倍。
第九章
连马斯克都点赞的发现 Attention Residuals
2026.03arXiv:2603.15031马斯克点赞

在 K3 发布之前,月之暗面还做了另一件有意思的事。

2026 年 3 月,他们发了篇论文叫 Attention Residuals。讲的是残差连接的替代方案

背景
自从 ResNet 2015 年提出以来,深度网络的标配就是残差连接——y = x + F(x)。就是把输入和计算结果加在一起。简单、有效、人人都在用。但有一个潜在问题:随着层数加深,残差信号会被稀释。

Kimi 的 Attention Residuals 提出了一个替代方案:不要简单相加,而是让注意力机制来决定残差路径的权重。每一层不是"输入+计算结果",而是"根据上下文决定输入该留多少、计算结果该加多少"。就像调音师,不是把两路信号简单混合,而是根据曲子风格动态调整每路的音量。

这篇论文有意思的地方不止于技术本身。论文的共同第一作者里,有一位 17 岁的深圳高中生,陈光宇。他加入月之暗面做研究一年,就参与了这项核心架构创新。

马斯克在 X 上转发了这篇论文,评论了两个字:"Impressive work from Kimi"

Attention Residuals 的意义:后来 K3 的架构里,KDA(线性注意力)+ AttnRes(残差替代方案)组合使用,架构效率比 K2 提升了约 2.5 倍。它不是 K3 成功的唯一原因,但它是最后一块拼图。
第九章
全球最大的开源模型 K3
2026.07.162.8T 参数896 专家

2026 年 7 月 16 日,就在这一周,月之暗面发布了 Kimi K3

2.8 万亿参数。896 个专家,每次激活 16 个。全球最大的开源模型。不是"国产最大",不是"亚洲最大",是全球最大。

数据
对比一下:DeepSeek-V4 是 1.6T 参数。K3 是 2.8T。大了 75%。而且 K3 的 896 个专家每个都是精挑细算——KDA 线性注意力 + Attention Residuals 残差连接,架构效率比 K2 提升了约 2.5 倍。

K3 的成绩单非常亮眼:Terminal Bench 2.1 得分 88.3,超越 Claude Opus 4.8 的 84.6。Arena.ai 前端编码排行榜全球第一。在编码和 Agent 任务上,K3 已经能和 Claude Fable 5、GPT-5.6 Sol 正面竞争。

Moonshot 还展示了一些惊人的 demo:K3 自主构建了一个 GPU 编译器,48 小时内完成了一个芯片设计,2 小时复现了一个计算天体物理学的完整管线——研究人员说这些任务通常需要一到两周。

定价:K3 API 每百万输出 token 15 美元。仍然比 Fable 5 的 50 美元便宜 70%。7 月 27 日全量权重开源。你已经可以在 Kimi.com、Kimi Code、Kimi API 上直接用。

K3 的意义不只是更大。它证明了一件事:KDA 线性注意力架构 + Muon 优化器 + Mooncake 推理引擎,这条全栈自研的路线,真的走到了全球前沿。从 K1.5 追平 o1,到 K2 开源 Agent 第一,到 K3 成为全球最大开源模型——月之暗面用了不到两年。

2023 年 10 月,Kimi Chat 上线时,它只是一个长文本聊天产品。2026 年 7 月,K3 发布时,它已经是全球开源模型的标杆。这中间发生了什么?不是运气,是一整套全栈自研的技术体系。
尾声
月之暗面的哲学

回头看 Kimi 的进化路径,和 DeepSeek 完全不同。

DeepSeek 是架构驱动——MoE → MLA → FP8 → GRPO → CSA/HCA,每一步都是架构上的原创。Kimi 是系统驱动——从产品出发,反推技术需求,在每个层面都有原创贡献:

K1.5 证明了 RL 不需要搜索和 PRM,长上下文就够了
Moonlight 验证了 Muon 可用于大规模 LLM 训练
Mooncake 用系统创新解决了推理成本问题
MuonClip 解决了 Muon 的稳定性问题
KDA 从架构层面消灭了 KV 缓存
Attention Residuals 让马斯克点赞,17 岁高中生参与
Agent Swarm 让多 Agent 并行从想法变成工程
K3 用 2.8T 参数证明了全栈自研的威力

DeepSeek 的故事告诉我们:架构选择的累积效应。Kimi 的故事告诉我们:系统级创新的力量——从内核到推理引擎到模型架构到 Agent 框架,全栈自研。

类比
如果 DeepSeek 是"专精深"——把架构做到极致。那么 Kimi 就是"全栈通"——每个层面都有原创,但每个层面都不是世界第一,合在一起产生了 1+1>2 的效果。

2023 年的 Kimi Chat 只是一个长文本聊天产品。三年后,月之暗面拥有了自己的优化器、自己的推理引擎、自己的注意力架构、自己的多模态模型、自己的 Agent 框架。这条路走得不快,但每一步都踩实了。

这,就是 Kimi 的故事。从月之暗面,到 AI 世界的正中央。


引用论文

[1] Kimi K1.5 — Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599.

[2] Moonlight / Muon — Kimi Team (2025). Muon is Scalable for LLM Training. arXiv:2502.16982.

[3] Mooncake — Qin et al. (2025). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. FAST 2025 Best Paper.

[4] Kimi K2 — Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534.

[5] KDA / Kimi Linear — Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692.

[6] Kimi K2.5 — Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276.

[7] Kimi-Dev — Yang et al. (2025). Kimi-Dev: Agentless Training as Skill Prior for SWE-Agents. arXiv:2509.23045.

[8] Attention Residuals — Kimi Team (2026). Attention Residuals: Rethinking Deep Directional Aggregation. arXiv:2603.15031. 马斯克点赞.

[9] KDA paper note — 深度精读. 论文笔记 #28.

[10] AttnRes paper note — 深度精读. 论文笔记 #26.