上一代的问题:标准残差连接以固定权重累加所有层,隐藏状态随深度线性增长,稀释每层贡献。
这代改了什么:用 softmax 的深度方向注意力替换固定累加:每层软注意力选哪些前层输出更有用。
效果:Kimi Linear 架构验证,所有下游任务有提升,推理开销 < 2%。
标准残差连接以固定权重累加所有层,隐藏状态随深度线性增长,稀释每层贡献(PreNorm dilution)。
用基于 softmax 的深度方向注意力替换固定累加:
时间维度(序列 RNN → Attention)与深度维度(残差累加 → 深度注意力)存在深刻对偶性。