26 · Attention Residuals (AttnRes)

深度注意力 Kimi Team 2026
Kimi Team · arXiv:2603.15031

迭代了什么

上一代的问题:标准残差连接以固定权重累加所有层,隐藏状态随深度线性增长,稀释每层贡献。

这代改了什么:用 softmax 的深度方向注意力替换固定累加:每层软注意力选哪些前层输出更有用。

效果:Kimi Linear 架构验证,所有下游任务有提升,推理开销 < 2%。

一、解决的问题

标准残差连接以固定权重累加所有层,隐藏状态随深度线性增长,稀释每层贡献(PreNorm dilution)。

二、核心创新

用基于 softmax 的深度方向注意力替换固定累加:

hl = Σi=0l−1 αi→l · vi
αi→l = softmax(wlT · RMSNorm(ki))

三、版本

四、核心洞察

时间维度(序列 RNN → Attention)与深度维度(残差累加 → 深度注意力)存在深刻对偶性。