上一代的问题:QK 点积值域无界,softmax 容易饱和——所有注意力集中到最亮的词上。
这代改了什么:对 Q 和 K 分别做 L2 归一化(余弦相似度),再用可学习参数 g 替代固定缩放 √d。
效果:5 个低资源翻译对平均 BLEU +0.93。GPT-4 已采用。可学习参数 g 最关键(去掉跌 8.71 BLEU)。
原始注意力计算中 QKT 的值域无界,点积可能变得非常大,导致 softmax 饱和(大多数概率集中在一个 token 上),限制了注意力头学习复杂模式。
先对 Q 和 K 做 L2 归一化,再用可学习参数 g 缩放。g 替代了固定缩放因子 √d,使模型可以自适应调节注意力分布的尖锐程度。
QKT 从无界点积变为有界余弦相似度(取值范围 [−1, 1]),从根本上解决了值域无界的问题。可学习参数 g 替代固定缩放 √d 是核心创新点——它让模型自主决定注意力分布的"温度"。
QK-Norm 被 GPT-4 等后续大型语言模型采用,成为提升注意力训练稳定性的重要技术。