13 · Sliding Window Attention (SWA) / Longformer

注意力 Beltagy et al. 2020
Beltagy et al., Allen AI · arXiv:2004.05150

迭代了什么

上一代的问题:BERT 只能处理 512 token 序列,长文档需分块导致信息丢失。

这代改了什么:滑动窗口(O(n×w))+ 空洞窗口 + 全局注意力(预选位置)三种稀疏模式组合。

效果:Mistral 和 Gemma 2 均采用滑动窗口 + GQA 组合。32K 长度可训,WikiHop 准确率 75.0 vs RoBERTa 72.4。

一、解决的问题

BERT 只能处理 512 token,长文档需分块导致信息丢失。

二、三种稀疏模式的组合

  1. Sliding Window:每个 token 关注相邻 w/2 个左右 token,复杂度 O(n×w)
  2. Dilated Sliding Window:空洞滑动窗口,感受野 = 层数×d×w
  3. Global Attention:少量预选位置做全局注意力

三、实际使用

Mistral 使用滑动窗口 + GQA,Gemma 2 使用交错 SWA + 全局注意力。