上一代的问题:深层网络随层数增加,训练和测试误差反而上升(梯度消失/爆炸)。
这代改了什么:学习差值而非直接映射:y = F(x) + x。梯度有高速直达通道。
效果:所有 Transformer 子层后都接残差连接。深度网络(100+ 层)训练成为可能。
深层网络退化:层数增加,训练和测试误差反而上升。不是过拟合,而是优化困难。
残差连接让梯度可以直接流向浅层(恒等映射路径),避免梯度消失。在 Transformer 中,每个子层后都接残差连接。