LLM 架构进化史
30 篇论文串成一条线——非学术视角看 Transformer 架构这十年
三个信念每年都在被挑战:需要 RNN、需要 CNN、顺序计算是必要的。
2017 年之前,做机器翻译必须用 RNN(循环神经网络)。每个词依次处理,前面的词算完才能算后面的,没法并行。有人试过把 RNN 换成 CNN(卷积),并行搞定了,但远距离的词之间要绕很多层才能建立联系。
Transformer 干了什么? 它说:序列不是一步步走的,而是一张全连接图,任何两个位置之间最多一步。
→
问题:RNN 串行处理,长序列下并行不了。CNN 能并行但看不清远处的词。
瓶颈训练慢,翻译质量天花板到了。
01
Attention Is All You Need — Transformer 横空出世
多头注意力 + 位置编码 + 残差连接。BLEU 28.4 vs 之前 SOTA 26.3。8 张 P100 训 3.5 天。
但 Transformer 有两个暗伤:
① 训练不稳定,必须从极低学习率开始"预热"(warmup)。离了这个技巧模型就炸。
② 注意力是 O(n²) 的——序列长一倍,计算量大四倍。处理长文章非常贵。
③ 还有一个当时没人注意的问题:KV 缓存。推理时每个历史词都要存 Key 和 Value,越长的对话,显存占用越大。
暗伤
① 训练不稳 ② O(n²) 复杂度 ③ KV 缓存随序列增长
后续所有工作,本质上都是在修这三点。一个一个来。
"如果没有 ResNet 和 LayerNorm,Transformer 根本堆不深。"
这一阶段不是 Transformer 专属——这些技术来自计算机视觉和 RNN 领域,但 Transformer 恰好需要它们。
24
ResNet (2015) — 深度残差学习
让网络学习"差值"而非直接映射,梯度有了高速公路可以直达输入层。
02
LayerNorm (2016) — 层归一化
每个样本自己算均值和方差,不依赖 batch。Transformer 正是靠这个而不是 BatchNorm 来稳定训练。
06
GELU (2016) + SiLU/Swish (2017) — 更好的激活函数
ReLU 太硬了(负半轴一刀切零)。GELU 按概率加权:值大就保留,值小就过滤,梯度也平滑。
04
Pre-LN (2020) — LayerNorm 该放在哪?
原版 Transformer 把 LN 放在子层之后(Post-LN),必须 warmup 才能训。把 LN 移到子层之前,warmup 直接扔掉,训练提速 40%。
03
RMSNorm (2019) — LN 的简化版
去掉 LN 的均值计算,只算 RMS。LLaMA、Mistral、Gemma 全部改用这个。
05
QK-Norm (2020) — 注意力内部也要归一化
QK 点积太大时 softmax 会"饱和"——所有注意力集中到最"亮"的那个词上。对 Q 和 K 分别做 L2 归一化,注意力分布更健康。
到这一步,Transformer 能稳定训练了。但 O(n²) 的问题还没碰。
"注意力很贵。能不能少算一点?" 这条路上有两次完全不同的竞赛。
竞赛 A:让 KV 缓存变小(推理加速)。模型说话时,每次吐一个字都要翻一遍历史 KV,KV 越小越快。
竞赛 B:让注意力矩阵稀疏化(训练加速)。不是每个词都要看到全文,就近的看清楚就够了。
竞赛 A:KV 缓存变小——MQA → GQA → MLA
08
MQA (2019) — "所有头共享同一份 Key 和 Value"
原来每个注意力头都有自己的 K 和 V(8 份)。MQA:所有头共用 1 份 KV。KV 缓存降到 1/8,推理加速 ~12 倍。
09
GQA (2023) — "8 个头分 4 组,每组 1 份 KV"
MQA 省得多但亏一点质量。GQA 是中间方案,Llama 2/3、Mistral、Gemma 2 都选它。
10
MLA (2024) — "把 KV 压缩到低维空间再还原" — DeepSeek 的杀手锏
KV 缓存降到 MHA 的 14%。推理吞吐 8×H800 上超 50K tokens/s。质量还比 MHA 更好。
竞赛 B:注意力稀疏化——Sparse → SWA → Lightning
12
Sparse Transformer (2019) — "只看一部分位置"
把全注意力拆成几个稀疏模式,复杂度降到 O(n√n)。问题是稀疏模式是固定的,一张图适用,文本不一定。
13
SWA / Longformer (2020) — "只看附近的词,远处的交给堆叠"
每个词只看前后 w/2 个词,复杂度 O(n×w)。靠层数堆出感受野。Mistral、Gemma 2 都采用。
11
Lightning Attention (2024) — "用线性注意力"
改变算的顺序:(QK^T)V → Q(K^T V),从 O(n²) 变 O(n)。结合分块策略,92K 长度显存恒定。
这里缺了一篇关键论文:
—
⚠️ FlashAttention (2022) — "不改变计算量,但让注意力跑在 SRAM 上"
不是稀疏化,而是 IO-Aware。GPU 有快速小内存(SRAM)和慢速大内存(HBM)。标准注意力反复读写 HBM。FlashAttention 把计算分块,全部在 SRAM 上完成。2-4x 训练加速,是 LLM 时代最有工程价值的"基础设施"论文。
"Transformer 没有顺序感——你需要告诉他词与词之间的先后关系。"
Transformer 不像 RNN 天然有次序。原版用正弦/余弦波编码位置。这个方案在 2017 年够用,但后来发现了更好的办法。
14
RoPE (2021) — "旋转,而不是相加"
不是把位置信号 加 到词嵌入上,而是把 Q/K 向量 旋转——旋转角度正比于位置。好处:Q 和 K 的内积天然表达"相对位置"(多远),且不受绝对位置影响。几乎所有现代 LLM 都用了。
15
YaRN (2023) — "RoPE 看不远怎么办?"
RoPE 在训练长度之外表现很差。YaRN 的解决办法:高频维度(区分相邻词)不插值,低频维度(编码全局位置)拉伸。Llama 3 用这个从 8K 扩展到 128K。
16
NoPE (2023) — "也许根本不需要位置编码?"
因果掩码(只能看前面)本身就给了模型顺序感。去掉位置编码后,长度泛化反而最好。这推动 Mamba 等模型彻底去掉了位置编码。
这里缺的:
—
⚠️ ALiBi (2022) — "给注意力加上距离惩罚"
一个更简单的方案:在 QK^T 的结果上减去一个与距离成正比的偏置。越远的词注意力越低。不在 RoPE vs NoPE 之间选——它走的是第三条路。MPT 和 Bloom 用了它。
"传统 dense 模型:每个人每次调用都激活全部参数。MoE:每次只激活一小部分。"
GPT-4、DeepSeek V3、Mixtral——这些最先进的模型都是 MoE。MoE 的哲学其实很简单:模型可以很大(万亿参数),但每个 token 只激活一小部分参数。
17
Sparse MoE (2017) — 原始 MoE 门控:Noisy Top-K
每个 token 送给得分最高的 k 个专家。加了噪声做负载均衡。17 年的 137B LSTM MoE 就已经做到了。
18
Switch Transformer (2021) — "简化到 Top-1"
Top-2 太麻烦,每个 token 只发给 1 个专家。训练更稳定,首次实现万亿参数模型(Switch-C 1.6T)。
19
DeepSeek MoE (2024) — 细粒度专家 + 共享专家
两招:① 把大专家切成很多小专家(组合更灵活)。② 设几个"公共专家"一直开着,处理所有 token 都需要的通用知识。145B 模型仅用 28.5% 计算量达到 67B Dense 的性能。
20
Gated DeltaNet (2024) — MoE + 线性 RNN 融合
把门控(快速遗忘)和 delta 规则(精准更新)统一成一个递推公式。混合架构的新方向。
这里缺的:
—
⚠️ GShard (2020) — Google 的第一个 MoE Transformer
在 Sparse MoE(2017,基于 LSTM)和 Switch Transformer(2021)之间,GShard 是第一个把 MoE 装进 Transformer 的。Top-2 门控、分布式专家分片、负载均衡——后来的 MoE 几乎都沿用了这套设计。
"如果不用注意力,序列建模还有没有别的路径?有——状态空间模型。"
注意力虽好,但 O(n²) 是硬伤。状态空间模型(SSM)从控制理论借来了另一个框架。最引人注目的当属 Mamba 系列。
21
Mamba v1 (2023) — "让 SSM 的转换矩阵随输入变化"
之前的 SSM(S4)是"对所有输入一视同仁"的,在需要"记住张三说的话、忽略李四说的话"时不够灵活。Mamba 让门控参数随当前输入变化,结果:3B 模型匹配 6.9B Transformer。推理 5x 吞吐提升。
22
Mamba 2 (2024) — "发现:SSM 本质上是一种注意力"
把 Mamba 1 的递推公式展开成矩阵形式——恰好是一个结构化的注意力矩阵。有了这个视角,SSM 可以复用 Attention 的优化技巧。训练 2-8x 加速,状态维度从 16 提升到 256。
23
Mamba 3 (2026) — "复数状态 + 多通道"
加了三个大招:① 复数状态(能处理旋转、奇偶校验等精确推理)。② 更精确的离散化方法。③ 多输入多输出(推理算术强度提升)。1.5B 超越 Transformer/Mamba 2/Gated DeltaNet。
缺的:
—
⚠️ S4 (2021) — "Mamba 之前的 SSM"
结构化状态空间模型。Mamba 的"父论文"。S4 证明了 SSM 能做序列建模,但它的参数是固定的(时不变),缺少"选择性"——而这一步正是 Mamba 完成的。
—
Hyena (2023) — "显式卷积代替注意力"
在 Mamba 之前的前沿探索。用长卷积(+ 数据门控)替代注意力。在 1.4B 上证明有效,但 Mamba 很快用 SSM 框架超越了它。
"每一种架构都有优缺点。为什么要选?可以全都要。"
2024 年之后,共识形成:混合才是最优解。用注意力的地方用注意力(需要全局记忆时),用 SSM 的地方用 SSM(长序列效率),再用更好的残差连接把它们粘起来。
25
Hyper-Connections (2024) — "残差连接能不能学?"
标准残差只是"x + F(x)"。Hyper-Connections 让模型自己学:前一层该传多少到当前层?各层之间应该串联还是并联?
28
KDA / Kimi Linear (2025) — "3 层线性 + 1 层注意力"
月之暗面交出的答案:每 3 层 KDA(线性注意力/RNN) + 1 层 MLA(标准注意力)。首次在大规模上全面超越纯注意力。位置信息由 KDA 编码,MLA 层用 NoPE。
27
DeepSeek-V3.2 (2025) — "注意力 + 稀疏索引 + RL"
训练一个轻量索引器,每步只选 top-k 个 KV 条目。复杂度从 O(n²) 降到 O(nk)。后训练用 GRPO 强化学习。Agent 能力大幅提升。
26
Attention Residuals (2026) — "残差连接本身也可以用注意力"
标准残差是"每层等权相加"。改用 softmax 注意力来聚合各层——模型自己决定哪一层的输出更重要。注意力不仅用在"序列方向",还用在"深度方向"。
29
Gemma 2 (2024) — "工程师的方法论"
27B 模型超越 Llama 3 70B。怎么做到的?交错局部/全局注意力 + soft-capping + 蒸馏。不是在创新,而是把所有已知技术用到了极致。
已补上(编号 35-38)。这四篇是故事线中缺失的关键章节:
⭐
FlashAttention (Dao et al., 2022)
为什么缺了它故事讲不通: 第三幕(注意力变体)里所有工作都在"减少计算量",但 FlashAttention 走了完全不同的路——不减少计算量,但让每次计算都跑在最快的硬件上。
GPU 里有一种叫 SRAM(~20MB,超快)和 HBM(~80GB,相对慢)。标准注意力每次计算都读写 HBM,带宽是瓶颈。FlashAttention 把注意力矩阵分块,每块完整计算在 SRAM 中完成,最后写回 HBM。2-4x 训练加速。
没有 FlashAttention,不可能有 128K 上下文的 Llama 3,也不会有 MLA 的工程化。它是 LLM 时代的"混凝土"——没人谈论它,但每栋楼都在它上面。
⭐
S4 — Structured State Space (Gu et al., 2021)
为什么缺了它故事讲不通: 第六幕直接从 Transformer 跳到 Mamba 1 是断档的。一个称为 S4 的中间步骤非常重要——它证明了 SSM 可以做序列建模,但它的矩阵是固定的(时不变),不能根据输入动态选择记住什么、忽略什么。Mamba 的全部工作在"S4 的矩阵参数改为输入相关"——这个"选择性"的一小步,就是 S4 到 Mamba 的全部区别。
⭐
GShard (Lepikhin et al., 2020)
为什么缺了它故事讲不通: 第五幕从 Sparse MoE(2017,基于 LSTM)直接跳到 Switch Transformer(2021)。中间有一个关键:GShard 是第一个把 MoE 装进 Transformer 的,验证了"Top-2 路由 + 分布式专家分片 + 辅助负载均衡损失"这套流程可行。没有 GShard 的工程验证,Switch Transformer 和 DeepSeek MoE 可能走很多弯路。
⭐
ALiBi (Press et al., 2022)
为什么缺了它故事讲不通: 第四幕(位置编码)里 RoPE 和 NoPE 是两条路,但还有第三条路——ALiBi。它不是在 Q/K 上做文章,而是直接在 softmax 之前的注意力得分上减去一个距离偏置。越远的词减得越多。简单、效果好、且天然支持任意长度外推。它被 MPT、BLOOM 等模型采用,与 RoPE 形成了"你到底应该在哪个环节注入位置信息"这个问题的两个不同答案。
补上这四篇,故事线就完整了: FlashAttention(硬件加速)→ S4(SSM 基础)→ GShard(MoE+Transformer 首次结合)→ ALiBi(位置编码另一条路)。
它们不是"锦上添花",而是故事里缺失的关键章节。少了任何一篇,你都会在阅读笔记时感觉到跳跃。