28 · Kimi Delta Attention (KDA / Kimi Linear)

线性注意力 Kimi Team 2025
Kimi Team · arXiv:2510.26692

迭代了什么

上一代的问题:线性注意力在表达力上长期落后 softmax 注意力。Gated DeltaNet 门控不够细。

这代改了什么:细粒度 channel-wise forget gate(α_t ∈ [0,1]^{d_k})+ 3:1 KDA:MLA 混合架构。位置信息由 KDA 编码。

效果:首次在大规模(48B/3B)上全面超越纯注意力基线。~1.16× 计算效率优势。

一、核心创新:细粒度门控

KDA 核心更新:

St = (I − βt · kt · ktT) · Diag(αt) · St−1 + βt · kt · vtT
ot = StT · qt
αth = f(Wα · Wα · xt) ∈ [0,1]dk

其中 αth 是 channel-wise forget gate,βth = Sigmoid(Wβh · xt) 是数据相关的学习率。

二、混合架构

3 个 KDA 层 + 1 个 MLA(NoPE)层。KDA 编码位置信息(等价于可学习位置编码),MLA 层用 NoPE。

三、缩放定律

Kimi Linear 达到约 1.16× 计算效率优势。首次在大规模(48B 总参/3B 激活)上全面超越强基线。