本文提出Kuramoto注意力层,将振荡器同步机制引入自注意力。每个令牌携带一组相位振荡器,隐藏状态位于高维环面。注意力权重形成自适应耦合图,值更新恰为固定注意力权重的Kuramoto耦合方向。在enwiki8和CodeParrot数据集上,5M参数模型优于参数匹配的RoPE和SwiGLU Transformer。消融和相位诊断显示同步和几何组件对性能的影响。

核心观点

技术要点

利用相位振荡器在环面上的同步,注意力权重决定振荡器之间的耦合,值更新通过注意力加权的圆形均值实现。该机制使学习到的计算可直接解读为相位状态的自适应同步。

应用场景

计算认知模型、神经表示学习、语言建模(如enwiki8、CodeParrot),以及需要绑定和协调的动态交互任务