上一代的问题:BERT 只能处理 512 token 序列,长文档需分块导致信息丢失。
这代改了什么:滑动窗口(O(n×w))+ 空洞窗口 + 全局注意力(预选位置)三种稀疏模式组合。
效果:Mistral 和 Gemma 2 均采用滑动窗口 + GQA 组合。32K 长度可训,WikiHop 准确率 75.0 vs RoBERTa 72.4。
BERT 只能处理 512 token,长文档需分块导致信息丢失。
Mistral 使用滑动窗口 + GQA,Gemma 2 使用交错 SWA + 全局注意力。