上一代的问题:Post-LN(LN 放在残差之后)必须 warmup 学习率,否则梯度爆炸。
这代改了什么:把 LN 移到子层之前(Pre-LN),残差路径保持恒等映射。
效果:扔掉 warmup,训练更稳定。BERT 预训练提速 40%。当今绝大多数 Transformer 的默认配置。
原始 Transformer(Post-LN)需要复杂的学习率预热(warmup),否则训练初期梯度爆炸。论文从均值场理论证明是 LN 位置导致的梯度问题。
LN 放在残差连接之后,对残差分支和主干的输出一起归一化。
LN 放在残差连接之前,最后在输出层接一个 final LayerNorm。残差路径保持恒等映射。
Pre-LN 不需要 warmup,收敛更快(BERT 预训练提速 40%),已成为当今绝大多数 Transformer 模型的默认配置。