LLM 架构演进 · 论文精读笔记

41 篇论文 + 国产模型解说稿,从 Transformer 到推理部署——理解 LLM 整个技术栈。

全球进化故事线 国产模型轨迹 DeepSeek 故事 Kimi 故事 41 篇论文精读
Phase 1 · 起源
Transformer 原文 + 激活函数 + 归一化——从零理解 LLM 的基石。

Phase 2 · 注意力变体
从 MQA 到 MLA,注意力机制的计算优化演进。

Phase 3 · 位置编码
从正弦波到旋转位置编码,位置信息如何塑造 LLM。

Phase 4 · 混合专家 (Mixture of Experts)
稀疏激活——让万亿参数模型变得可行。

Phase 5 · 状态空间模型 (State Space Models)
Mamba 系列——注意力机制的替代方案?

Phase 6 · 混合架构
Attention + SSM + Conv + MoE 的组合创新——2024-2026 年的新趋势。

Phase 7 · 推理部署(Serving Trilogy)
模型架构之外的另一半:KV Cache 管理、调度、结构化生成——让 LLM 真正跑起来的工程学问。

Phase 8 · Agent 系统
超越单模型推理,多 Agent 协调与去中心化。

Phase 9 · 替代架构与新方向
Attention 之外的路:可增长记忆 RNN、状态空间模型的前身。

补遗 · 缺失的关键拼图
补上这四篇,故事线完整了:FlashAttention(硬件加速)→ S4(SSM 基础)→ GShard(MoE+Transformer)→ ALiBi(位置编码另一条路)。

国产模型关键论文 · 新增精读
DeepSeek 系列最新三篇深度笔记——mHC、R1、V4。

国产模型故事线 · 解说稿(含配音)

📚 配套教程
Transformer 可视化教程(与上面笔记有重叠,但以教程形式编写,适合入门阅读)。

Transformer Explainer 系列
8 篇中文教程:注意力机制 → 自注意力可视化 → 多头注意力 → 位置编码 → 层归一化与残差连接 → 编码器解码器 → RNN/CNN 对比 → 交互式操作指南
本地