27 · DeepSeek-V3.2 — Sparse Attention + RL Scaling

稀疏注意力 DeepSeek 2025
DeepSeek · arXiv:2512.02556

迭代了什么

上一代的问题:标准注意力 O(n²) 计算复杂度限制了长上下文效率。

这代改了什么:轻量级闪电索引器为每个查询选 top-k 个 KV 条目 + GRPO 强化学习。基于 MLA 实现。

效果:H800 上长序列预填充和解码成本大幅降低。Agent 能力大幅提升。

一、核心创新:DSA (DeepSeek Sparse Attention)

用轻量级"闪电索引器"为每个查询 token 选择 top-k 个 KV 条目:

It,s = Σ wt,jI · ReLU(qt,jI · ksI)
ut = Attn(ht, {cs | It,s ∈ Top-k(It,:)})

二、基于 MLA 实现

DSA 基于 DeepSeek 之前发明的 MLA 注意力,以 MQA 模式实现稀疏化。

三、GRPO 强化学习

JGRPO(θ) = E[1/G Σ min(ri,t(θ)Âi,t, clip(...)Âi,t) − β·DKL]

结合推理(reasoning)和工具使用(agentic)能力,在 H800 上训练。