03 · RMS Layer Normalization

归一化 Zhang & Sennrich, 2019
Biao Zhang, Rico Sennrich · arXiv:1910.07467

迭代了什么

上一代的问题:LayerNorm 需要计算均值和方差两次归约,计算开销大。

这代改了什么:假设 re-centering 不变性是可选的,只保留 re-scaling——只算 RMS,去掉均值。

效果:LLaMA、Mistral、Gemma 等所有现代开源模型弃用 LN 改用 RMSNorm。速度提升 7-9%。

一、解决的问题

LayerNorm 需要计算均值和方差两个统计量(两次归约操作),计算开销大。在 RNN 中 LN 使每步速度慢了 67%。

二、核心假设

LayerNorm 的去中心化(re-centering)不变性是可选的,只有重新缩放(re-scaling)不变性才是成功的关键。因此可以完全移除均值计算。

三、核心公式

RMS(a) = √( (1 / n) · Σ ai² )
RMSNorm(ai) = ai / RMS(a) · gi

其中 gi 是可学习的缩放参数。相比 LN,RMSNorm 去掉了均值计算和偏移参数 bi

四、关键性质

当输入均值为 0 时,RMSNorm 与 LN 完全等价。RMS(αx) = α · RMS(x) 保证了权重矩阵缩放不变性——这是归一化方法有效性的核心。

五、实际影响

LLaMA 系列(LLaMA 1/2/3)、Mistral、Gemma 等现代开源模型全部使用 RMSNorm 替代 LN。速度提升 7%–9%(Transformer)到 11%–34%(RNN),效果与 LN 无明显差异。