41 · DeepSeek-V4: 百万上下文 + 混合注意力

国产里程碑 1M上下文 DeepSeek · 2026.04
DeepSeek-AI · HuggingFace: deepseek-ai/deepseek-v4

上一代的问题:DeepSeek-V3.2 的 MLA 全注意力在 128K+ 上下文时二次复杂度不可承受;标准 KV 缓存随上下文线性增长,1M 上下文时 BF16 GQA8 的 KV 缓存大至无法实用。

这代改了什么:三轨混合注意力:CSA(压缩稀疏注意力,m=4 + DSA Top-K)+ HCA(重度压缩注意力,m'=128)+ 滑动窗口 (128)。配合 mHC 残差连接、Muon 优化器、FP4 QAT 量化。

效果:1M 上下文 KV 仅标准方案的 2%(Flash)至 10%(Pro)。MRCR 1M 达 92.9%(超 Opus 4.6 的 83.5%)。SWE Verified 80.8%。1.6T 参数/49B 激活。

一、架构总览

参数V4-ProV4-FlashV3.2
总参/激活1.6T / 49B284B / 13B671B / 37B
MoE 专家1 shared + 384 routed (6 active)1 shared + 256 routed (6 active)1 shared + 256 routed (8 active)
注意力CSA + HCA + SWACSA + SWAMLA (全注意力) + DSA
残差连接mHC (n=4)mHC (n=4)标准残差
优化器MuonMuonAdamW
训练 token33T32T14.8T
上下文1M1M128K

二、核心创新

2.1 混合注意力 (CSA + HCA + SWA)

KVCSA: 每 m=4 个 token 压缩为 1 个,DSA Top-K=1024
KVHCA: 每 m'=128 个 token 压缩为 1 个,全注意力
KVSWA: 滑动窗口 n_win=128,局部细粒度依赖
三轨并行:CSA 负责中等粒度、HCA 负责全局语义、SWA 负责局部精度

2.2 mHC 残差连接

详见 #39 mHC 笔记。双随机流形约束的 n 流残差连接,Amax Gain 从 3000 降到 1.6,仅 6.7% 开销。

2.3 Muon 优化器

替代 AdamW 用于除 Embedding/Head/Norm 外的所有参数:

Mk = a·Mk-1 + b·(M·MT)·M + c·(M·MT)2·M
混合 Newton-Schulz 迭代:8 步快速收敛 + 2 步稳定

三、关键结果

基准V4-ProV3.2Opus 4.6Gemini 3.1
MMLU90.187.8----
SimpleQA55.228.357.9*75.6*
HumanEval76.862.8----
MRCR 1M (MMR)92.9--83.576.3
CorpusQA 1M71.7--62.053.8
SWE Verified80.873.1*80.6--
Putnam 2025120/120------

四、工程创新

五、DeepSeek 系列演变

版本时间核心创新参数上下文
DeepSeek-MoE2024.01细粒度 MoE + 共享专家--4K
DeepSeek-V22024.05MLA(低秩 KV 压缩)236B/21B128K
DeepSeek-V32024.12671B MoE + MTP + FP8671B/37B128K
DeepSeek-R12025.01GRPO RL 推理671B/37B128K
DeepSeek-V3.22025.03DSA 稀疏注意力671B/37B128K
DeepSeek-V42026.04CSA/HCA 混合注意 + mHC + Muon1.6T/49B1M

六、个人思考

V4 最令人印象深刻的是系统级创新密度——混合注意力、mHC、Muon、FP4 QAT、MegaMoE、TileLang、DSec Sandbox……几乎每一层都有原创贡献。这不仅仅是"更大的模型",而是一个完整的系统工程升级。

混合注意力(CSA + HCA + SWA)的设计理念值得关注:不做单一选择,而是三个互补机制并行——局部精度、中等粒度稀疏、全局语义各司其职。这让 1M 上下文变得实用(KV 仅标准方案 2%),而不是理论可行。