Tom
ABC
Always Be Curious
简报
文章
论文故事
系列 v1
系列
探索实践
LLM 架构演进 · 论文精读笔记
41 篇论文 + 国产模型解说稿,从 Transformer 到推理部署——理解 LLM 整个技术栈。
全球进化故事线
国产模型轨迹
DeepSeek 故事
Kimi 故事
41 篇论文精读
Phase 1 · 起源
Transformer 原文 + 激活函数 + 归一化——从零理解 LLM 的基石。
01
Attention Is All You Need
Vaswani et al. · Google Brain · 2017
核心
Transformer
✓ 已读
02
Gaussian Error Linear Units (GELU)
Hendrycks & Gimpel · 2016
激活函数
已读
03
SiLU / Swish — Sigmoid Linear Unit
Elfwing et al. · Ramachandran et al. · 2017
激活函数
已读
04
Layer Normalization
Ba et al. · 2016
归一化
已读
05
Root Mean Square Layer Normalization
Zhang & Sennrich · 2019
归一化
已读
06
On Layer Normalization in Transformer (Pre-LN / Post-LN)
Xiong et al. · 2020
归一化
已读
07
Query-Key Normalization in Transformers
Henry et al. · 2020
归一化
已读
Phase 2 · 注意力变体
从 MQA 到 MLA,注意力机制的计算优化演进。
08
Multi-Query Attention
Shazeer · Google · 2019
注意力
KV 缓存
已读
09
Grouped Query Attention
Ainslie et al. · Google · 2023
注意力
MQA → GQA
已读
10
Multi-head Latent Attention (MLA)
DeepSeek · 2024
关键创新
低秩 KV
已读
11
Lightning Attention (TransNormer)
Qin et al. · 2024
注意力
线性
已读
12
Generating Long Sequences with Sparse Transformers
Child et al. · OpenAI · 2019
注意力
稀疏
已读
13
Longformer / Sliding Window Attention
Beltagy et al. · Allen AI · 2020
注意力
窗口
已读
Phase 3 · 位置编码
从正弦波到旋转位置编码,位置信息如何塑造 LLM。
14
RoFormer — Rotary Position Embedding (RoPE)
Su et al. · 2021
核心
位置编码
已读
15
YaRN — Efficient Context Window Extension
Peng et al. · 2023
长上下文
已读
16
No Positional Encoding (NoPE)
Haviv et al. · 2023
位置编码
已读
Phase 4 · 混合专家 (Mixture of Experts)
稀疏激活——让万亿参数模型变得可行。
17
Outrageously Large Neural Networks (Sparse MoE)
Shazeer et al. · Google · 2017
MoE
已读
18
Switch Transformer
Fedus et al. · Google · 2021
MoE
已读
19
DeepSeek MoE
DeepSeek · 2024
关键创新
共享专家
已读
20
Gated DeltaNet
2024
MoE
门控
已读
Phase 5 · 状态空间模型 (State Space Models)
Mamba 系列——注意力机制的替代方案?
21
Mamba — Linear-Time Sequence Modeling (S6)
Gu & Dao · 2023
SSM
选择性
已读
22
Mamba 2 — Transformers are SSMs
Dao & Gu · 2024
SSM
SSD
已读
23
Mamba 3
Gu et al. · 2026
SSM
已读
Phase 6 · 混合架构
Attention + SSM + Conv + MoE 的组合创新——2024-2026 年的新趋势。
24
Residual Connections (ResNet) — 深度残差学习
He et al. · Microsoft · 2015
残差
已读
25
Hyper-Connections (HC) — 可学习残差连接矩阵
ByteDance · 2024 (ICLR 2025)
混合
残差
已读
26
Attention Residuals — 深度方向注意力代替残差连接
Kimi Team · Moonshot AI · 2026
深度注意力
已读
27
DeepSeek-V3.2 — Sparse Attention (DSA) + RL Scaling
DeepSeek · 2025
稀疏注意力
大规模 RL
已读
28
Kimi Delta Attention (KDA) — 细粒度门控线性注意力
Kimi Team · Moonshot AI · 2025
线性注意力
混合架构
已读
29
Gemma 2 — 交错 SWA + Soft Capping + 知识蒸馏
Google DeepMind · 2024
SWA
Soft Capping
已读
Phase 7 · 推理部署(Serving Trilogy)
模型架构之外的另一半:KV Cache 管理、调度、结构化生成——让 LLM 真正跑起来的工程学问。
30
PagedAttention / vLLM — KV Cache 虚拟内存分页
Kwon et al. · UC Berkeley · 2023 (OSDI 2024)
推理部署
已读
31
Sarathi-Serve — Chunked Prefill 免停滞调度
Subramanian et al. · UC Berkeley · 2024
推理部署
已读
32
SGLang — RadixAttention + 结构化生成执行引擎
Zhang et al. · Tsinghua / Zhipu AI · 2023 (NeurIPS 2024)
推理部署
已读
Phase 8 · Agent 系统
超越单模型推理,多 Agent 协调与去中心化。
33
DeLM — Decentralized Multi-Agent Systems with Shared Context
Mao & Mirhoseini · Stanford · 2026
多Agent
已读
Phase 9 · 替代架构与新方向
Attention 之外的路:可增长记忆 RNN、状态空间模型的前身。
34
Memory Caching — RNNs with Growing Memory
Behrouz et al. · 2026
RNN
缓存
已读
补遗 · 缺失的关键拼图
补上这四篇,故事线完整了:FlashAttention(硬件加速)→ S4(SSM 基础)→ GShard(MoE+Transformer)→ ALiBi(位置编码另一条路)。
35
FlashAttention — IO-Aware Exact Attention
Dao et al. · Stanford · 2022
基础设施
已读
36
S4 — Structured State Space Sequence Model
Gu et al. · 2021
SSM 基础
已读
37
GShard — 首个 MoE + Transformer 工程实现
Lepikhin et al. · Google · 2020
MoE 基础
已读
38
ALiBi — Attention with Linear Biases
Press et al. · 2022
位置编码
已读
国产模型关键论文 · 新增精读
DeepSeek 系列最新三篇深度笔记——mHC、R1、V4。
39
mHC — 流形约束超连接
Xie et al. · DeepSeek · 2025
架构
残差连接
已读
40
DeepSeek-R1 — GRPO 推理革命
DeepSeek-AI · 2025
里程碑
推理
已读
41
DeepSeek-V4 — 百万上下文混合注意力
DeepSeek-AI · 2026
里程碑
1M上下文
已读
国产模型故事线 · 解说稿(含配音)
S1
DeepSeek 进化之路
V1 MoE → V2 MLA → V3 FP8 → R1 GRPO → V4 混合注意力 + 峰谷计价 · 10 分钟
解说稿
含配音
试听
S2
Kimi 的崛起
K1.5 → Moonlight → Mooncake → K2 → KDA → K2.5 → AttnRes → K3 · 8 分钟
解说稿
含配音
试听
S3
国产大模型发展轨迹 · 全景图
时间线 + 公司图谱 + 核心贡献 + 论文索引
全景图
已发布
📚 配套教程
Transformer 可视化教程(与上面笔记有重叠,但以教程形式编写,适合入门阅读)。
→
Transformer Explainer 系列
8 篇中文教程:注意力机制 → 自注意力可视化 → 多头注意力 → 位置编码 → 层归一化与残差连接 → 编码器解码器 → RNN/CNN 对比 → 交互式操作指南
本地