上一代的问题:Hyper-Connections (HC) 引入可学习矩阵扩展残差流,但 Hres 矩阵不受约束,多层复合映射偏离恒等映射,导致信号出现 3 个数量级的异常放大/衰减(Amax Gain ≈ 3000),训练出现 loss 尖峰。
这代改了什么:将 Hres 投影到双随机矩阵流形(Birkhoff 多面体)——行和列和都等于 1,非负。复合映射保持在同一流形内,谱范数 ≤1,彻底解决指数级信号放大。
效果:Amax Gain 从 ~3000 → ~1.6(降 3 个数量级)。27B 模型 8/8 基准超基线,7/8 超 HC。额外开销仅 6.7%。训练稳定性大幅提升。
自 ResNet (He et al., 2016) 以来,深度网络依靠恒等映射确保信号顺畅传播:
跨层的复合效果简洁优美:
但标准残差的表达力有限——每一层只有一个固定的"短路"路径。
HC (Zhu et al., 2024) 将残差流从维度 C 扩展到 n·C(n 个并行流),引入三个可学习映射矩阵:
但 Hres 的复合映射失去控制:
HC 的三个痛点:
核心洞察:问题不在扩展本身,而在于 Hres 缺乏约束。 如果将 Hres 限制在双随机矩阵流形(Birkhoff 多面体)上,则:
当 n=1 时,约束退化到标量 1,精确恢复恒等映射——mHC 是 HC 和标准残差的共同泛化。
对无约束矩阵 H̃res 做交替行列归一化将之投影到流形上:
实际取 tmax = 20,经实验验证精度足够。
mHC 的核心 kernel 设计:
前向时丢弃 mHC kernel 的中间激活。反向时仅重算轻量 mHC kernel(不重算 layer F)。每 Lr 层只存一次 xl0:
MLP 层的 Fpost,res 在专用高优计算流执行,与 pipeline 通信交叠。注意力层(长时 kernel)不走此路径避免持续 stall。
| 基准测试 | Baseline | HC | mHC |
|---|---|---|---|
| BBH (3-shot) | 43.8 | 48.9 | 51.0 |
| DROP (3-shot) | 47.0 | 51.6 | 53.9 |
| GSM8K (8-shot) | 46.7 | 53.2 | 53.8 |
| HellaSwag (10-shot) | 73.7 | 74.3 | 74.7 |
| MATH (4-shot) | 22.0 | 26.4 | 26.0 |
| MMLU (5-shot) | 59.0 | 63.0 | 63.4 |
| PIQA (0-shot) | 78.5 | 79.9 | 80.5 |
| TriviaQA (5-shot) | 54.3 | 56.3 | 57.6 |
| 指标 | HC | mHC | 提升 |
|---|---|---|---|
| Amax Gain(越接近 1 越好) | ~3000 | ~1.6 | 3 个数量级 |
| 额外开销 (n=4) | 较高 | 6.7% | 工程优化后 |
| 训练稳定性 | ~12k 步 loss 尖峰 | 稳定 | 平滑收敛 |
上一篇:Hyper-Connections (HC-2409.19606,笔记 #25) — 首次提出 n 流可学习残差,但训练不稳定。
并行:Attention Residuals (2603.15031,笔记 #26)、KDA (2510.26692,笔记 #28)、Gemma 2 SWA (2408.00118,笔记 #29) — 都是针对残差/注意力路径的改进方案。
引用/采用:出自 DeepSeek-AI 团队,与 DeepSeek-V2/V3 共享技术栈(MLA + DualPipe + TileLang),极有可能已用于实际训练。
这篇论文给我的最大启发是:自由度不是越多越好。 HC 增加了 n 流的自由度但没有约束,实际训练中信号失控到 3000 倍的放大。mHC 用双随机流形这个简洁的约束,既保留了 n 流混合的表达力,又确保了数值稳定性。
这体现了深度学习中一个反复出现的主题:结构约束让优化变容易。 就像 LayerNorm 约束了激活的均值和方差、ResNet 用恒等映射确保梯度流通一样,mHC 用数学上的"闭包"性质保证了跨层复合映射不会失控。
从工程角度看,6.7% 的开销对于训练稳定性的提升来说是非常值得的。而且 n=1 时退化到恒等映射,可以作为标准残差的"安全升级"——即使没有收益,也不会有损失。