上一代的问题:标准注意力 O(n²) 计算复杂度限制了长上下文效率。
这代改了什么:轻量级闪电索引器为每个查询选 top-k 个 KV 条目 + GRPO 强化学习。基于 MLA 实现。
效果:H800 上长序列预填充和解码成本大幅降低。Agent 能力大幅提升。
用轻量级"闪电索引器"为每个查询 token 选择 top-k 个 KV 条目:
DSA 基于 DeepSeek 之前发明的 MLA 注意力,以 MQA 模式实现稀疏化。
结合推理(reasoning)和工具使用(agentic)能力,在 H800 上训练。