上一代的问题:DeepSeek-V3.2 的 MLA 全注意力在 128K+ 上下文时二次复杂度不可承受;标准 KV 缓存随上下文线性增长,1M 上下文时 BF16 GQA8 的 KV 缓存大至无法实用。
这代改了什么:三轨混合注意力:CSA(压缩稀疏注意力,m=4 + DSA Top-K)+ HCA(重度压缩注意力,m'=128)+ 滑动窗口 (128)。配合 mHC 残差连接、Muon 优化器、FP4 QAT 量化。
效果:1M 上下文 KV 仅标准方案的 2%(Flash)至 10%(Pro)。MRCR 1M 达 92.9%(超 Opus 4.6 的 83.5%)。SWE Verified 80.8%。1.6T 参数/49B 激活。
| 参数 | V4-Pro | V4-Flash | V3.2 |
|---|---|---|---|
| 总参/激活 | 1.6T / 49B | 284B / 13B | 671B / 37B |
| MoE 专家 | 1 shared + 384 routed (6 active) | 1 shared + 256 routed (6 active) | 1 shared + 256 routed (8 active) |
| 注意力 | CSA + HCA + SWA | CSA + SWA | MLA (全注意力) + DSA |
| 残差连接 | mHC (n=4) | mHC (n=4) | 标准残差 |
| 优化器 | Muon | Muon | AdamW |
| 训练 token | 33T | 32T | 14.8T |
| 上下文 | 1M | 1M | 128K |
详见 #39 mHC 笔记。双随机流形约束的 n 流残差连接,Amax Gain 从 3000 降到 1.6,仅 6.7% 开销。
替代 AdamW 用于除 Embedding/Head/Norm 外的所有参数:
| 基准 | V4-Pro | V3.2 | Opus 4.6 | Gemini 3.1 |
|---|---|---|---|---|
| MMLU | 90.1 | 87.8 | -- | -- |
| SimpleQA | 55.2 | 28.3 | 57.9* | 75.6* |
| HumanEval | 76.8 | 62.8 | -- | -- |
| MRCR 1M (MMR) | 92.9 | -- | 83.5 | 76.3 |
| CorpusQA 1M | 71.7 | -- | 62.0 | 53.8 |
| SWE Verified | 80.8 | 73.1* | 80.6 | -- |
| Putnam 2025 | 120/120 | -- | -- | -- |
| 版本 | 时间 | 核心创新 | 参数 | 上下文 |
|---|---|---|---|---|
| DeepSeek-MoE | 2024.01 | 细粒度 MoE + 共享专家 | -- | 4K |
| DeepSeek-V2 | 2024.05 | MLA(低秩 KV 压缩) | 236B/21B | 128K |
| DeepSeek-V3 | 2024.12 | 671B MoE + MTP + FP8 | 671B/37B | 128K |
| DeepSeek-R1 | 2025.01 | GRPO RL 推理 | 671B/37B | 128K |
| DeepSeek-V3.2 | 2025.03 | DSA 稀疏注意力 | 671B/37B | 128K |
| DeepSeek-V4 | 2026.04 | CSA/HCA 混合注意 + mHC + Muon | 1.6T/49B | 1M |
V4 最令人印象深刻的是系统级创新密度——混合注意力、mHC、Muon、FP4 QAT、MegaMoE、TileLang、DSec Sandbox……几乎每一层都有原创贡献。这不仅仅是"更大的模型",而是一个完整的系统工程升级。
混合注意力(CSA + HCA + SWA)的设计理念值得关注:不做单一选择,而是三个互补机制并行——局部精度、中等粒度稀疏、全局语义各司其职。这让 1M 上下文变得实用(KV 仅标准方案 2%),而不是理论可行。