上一代的问题:小模型在固定数据量下性能提升仅对数级。
这代改了什么:交错局部/全局注意力 + Logit Soft-Capping + 双 RMSNorm + 知识蒸馏。不做架构革命,组合已知技术。
效果:27B 模型(Elo 1218)超越 Llama 3 70B(Elo 1206),小参数规模上实现高水平性能。
交错局部/全局注意力:每两层交替
注意力层 soft_cap=50.0,最终层=30.0。防止 logits 异常增长。
每个子层的输入和输出均做 RMSNorm(Pre + Post)。
从大模型蒸馏到小模型。
Gemma 2 27B(Elo 1218)超越 Llama 3 70B(Elo 1206),小参数规模上实现高水平性能。