04 · Pre-LN vs Post-LN

归一化 Xiong et al., 2020
Ruibin Xiong, Yunchang Yang, Di He, Kai Zheng, Shuxin Zheng, Chen Xing, Huishuai Zhang, Yanyan Lan, Liwei Wang, Tie-Yan Liu · arXiv:2002.04745

迭代了什么

上一代的问题:Post-LN(LN 放在残差之后)必须 warmup 学习率,否则梯度爆炸。

这代改了什么:把 LN 移到子层之前(Pre-LN),残差路径保持恒等映射。

效果:扔掉 warmup,训练更稳定。BERT 预训练提速 40%。当今绝大多数 Transformer 的默认配置。

一、解决的问题

原始 Transformer(Post-LN)需要复杂的学习率预热(warmup),否则训练初期梯度爆炸。论文从均值场理论证明是 LN 位置导致的梯度问题。

二、架构对比

Post-LN(原始 Transformer)

LayerNorm(x + Sublayer(x))

LN 放在残差连接之后,对残差分支和主干的输出一起归一化。

Pre-LN

Sublayer(LayerNorm(x)) + x

LN 放在残差连接之前,最后在输出层接一个 final LayerNorm。残差路径保持恒等映射。

三、核心发现

四、关键结论

Pre-LN 不需要 warmup,收敛更快(BERT 预训练提速 40%),已成为当今绝大多数 Transformer 模型的默认配置。