上一代的问题:LayerNorm 需要计算均值和方差两次归约,计算开销大。
这代改了什么:假设 re-centering 不变性是可选的,只保留 re-scaling——只算 RMS,去掉均值。
效果:LLaMA、Mistral、Gemma 等所有现代开源模型弃用 LN 改用 RMSNorm。速度提升 7-9%。
LayerNorm 需要计算均值和方差两个统计量(两次归约操作),计算开销大。在 RNN 中 LN 使每步速度慢了 67%。
LayerNorm 的去中心化(re-centering)不变性是可选的,只有重新缩放(re-scaling)不变性才是成功的关键。因此可以完全移除均值计算。
其中 gi 是可学习的缩放参数。相比 LN,RMSNorm 去掉了均值计算和偏移参数 bi。
当输入均值为 0 时,RMSNorm 与 LN 完全等价。RMS(αx) = α · RMS(x) 保证了权重矩阵缩放不变性——这是归一化方法有效性的核心。
LLaMA 系列(LLaMA 1/2/3)、Mistral、Gemma 等现代开源模型全部使用 RMSNorm 替代 LN。速度提升 7%–9%(Transformer)到 11%–34%(RNN),效果与 LN 无明显差异。