24 · Deep Residual Learning (ResNet)

残差 He et al. 2015
He et al., Microsoft Research · arXiv:1512.03385

迭代了什么

上一代的问题:深层网络随层数增加,训练和测试误差反而上升(梯度消失/爆炸)。

这代改了什么:学习差值而非直接映射:y = F(x) + x。梯度有高速直达通道。

效果:所有 Transformer 子层后都接残差连接。深度网络(100+ 层)训练成为可能。

一、解决的问题

深层网络退化:层数增加,训练和测试误差反而上升。不是过拟合,而是优化困难。

二、核心公式

F(x) = H(x) − x   (残差映射)
H(x) = F(x) + x   (原始映射)
残差块:y = F(x, {Wi}) + x
F = W2 · σ(W1 · x)

三、为什么有效

残差连接让梯度可以直接流向浅层(恒等映射路径),避免梯度消失。在 Transformer 中,每个子层后都接残差连接。