上一代的问题:线性注意力在表达力上长期落后 softmax 注意力。Gated DeltaNet 门控不够细。
这代改了什么:细粒度 channel-wise forget gate(α_t ∈ [0,1]^{d_k})+ 3:1 KDA:MLA 混合架构。位置信息由 KDA 编码。
效果:首次在大规模(48B/3B)上全面超越纯注意力基线。~1.16× 计算效率优势。
KDA 核心更新:
其中 αth 是 channel-wise forget gate,βth = Sigmoid(Wβh · xt) 是数据相关的学习率。
3 个 KDA 层 + 1 个 MLA(NoPE)层。KDA 编码位置信息(等价于可学习位置编码),MLA 层用 NoPE。
Kimi Linear 达到约 1.16× 计算效率优势。首次在大规模(48B 总参/3B 激活)上全面超越强基线。