29 · Gemma 2 — SWA + Soft Capping + 知识蒸馏

SWA Google DeepMind 2024
Google DeepMind · arXiv:2408.00118

迭代了什么

上一代的问题:小模型在固定数据量下性能提升仅对数级。

这代改了什么:交错局部/全局注意力 + Logit Soft-Capping + 双 RMSNorm + 知识蒸馏。不做架构革命,组合已知技术。

效果:27B 模型(Elo 1218)超越 Llama 3 70B(Elo 1206),小参数规模上实现高水平性能。

一、核心架构创新

交错局部/全局注意力:每两层交替

二、Logit Soft-Capping

logits ← soft_cap · tanh(logits / soft_cap)

注意力层 soft_cap=50.0,最终层=30.0。防止 logits 异常增长。

三、双 RMSNorm

每个子层的输入和输出均做 RMSNorm(Pre + Post)。

四、知识蒸馏

min Σ −PT(x|xc) log PS(x|xc)

从大模型蒸馏到小模型。

五、效果

Gemma 2 27B(Elo 1218)超越 Llama 3 70B(Elo 1206),小参数规模上实现高水平性能。