05 · Query-Key Normalization

归一化 注意力 Henry et al., 2020
Alex Henry, Prudhvi Raj Dachapally, Shubham Vivek Pawar, Yuxuan Chen · arXiv:2010.04245

迭代了什么

上一代的问题:QK 点积值域无界,softmax 容易饱和——所有注意力集中到最亮的词上。

这代改了什么:对 Q 和 K 分别做 L2 归一化(余弦相似度),再用可学习参数 g 替代固定缩放 √d。

效果:5 个低资源翻译对平均 BLEU +0.93。GPT-4 已采用。可学习参数 g 最关键(去掉跌 8.71 BLEU)。

一、解决的问题

原始注意力计算中 QKT 的值域无界,点积可能变得非常大,导致 softmax 饱和(大多数概率集中在一个 token 上),限制了注意力头学习复杂模式。

二、核心公式

原始注意力

Attention(Q, K, V) = softmax(QKT / √d) V

QK-Norm

i = qi / ||qi||₂
i = ki / ||ki||₂
Attention = softmax(g · Q̂ K̂T) V

先对 Q 和 K 做 L2 归一化,再用可学习参数 g 缩放。g 替代了固定缩放因子 √d,使模型可以自适应调节注意力分布的尖锐程度。

三、关键洞察

QKT 从无界点积变为有界余弦相似度(取值范围 [−1, 1]),从根本上解决了值域无界的问题。可学习参数 g 替代固定缩放 √d 是核心创新点——它让模型自主决定注意力分布的"温度"。

四、实验结果

五、实际影响

QK-Norm 被 GPT-4 等后续大型语言模型采用,成为提升注意力训练稳定性的重要技术。