Previous: Mamba2 sacrificed expressivity for efficiency -- can't do parity check (state tracking). Inference arithmetic intensity low (~2.5 ops/byte).
This: Three innovations: (1) Complex state space (rotation dynamics = data-dependent RoPE) solves state tracking. (2) Exponential-trapezoidal discretization O(Delta3). (3) MIMO multi-channel higher arithmetic intensity.
Effect: 1.5B model beats Transformer/Mamba2/GDN all baselines. MIMO variant half state dim matches Mamba2 perplexity.
随着 Chain-of-Thought(CoT)、Agentic AI 等推理时计算扩展范式的兴起,模型推理效率已经从"锦上添花"变为"核心瓶颈"。Transformer 的推理成本随序列长度线性增长(KV cache),在 Agent 场景中模型需要反复读取完整上下文,内存带宽成为天花板。
SSM 家族(Mamba1, Mamba2, Gated DeltaNet)理论上拥有 O(1) 推理复杂度——固定大小的状态向量足以概括历史信息,无需 KV cache。这使它们在长序列推理场景中具有天然优势。
Mamba2 通过结构化状态空间对偶(SSD)框架大幅提升了训练效率:将 SSM 的递归计算重写为矩阵乘法,得以利用 GPU 张量核心。但这一简化付出了代价——状态表达能力被削弱了。
关键证据是 状态追踪(state tracking)任务。例如奇偶校验(parity check):给定一个比特序列,判断其中 1 的个数是否为偶数。模型需要精确计数并记忆跨步的奇偶信息。Mamba2 在这类任务上表现极差(甚至接近随机猜测),而 Transformer 可以轻松解决。
理论上,次二次(sub-quadratic)模型拥有 O(1) 推理复杂度的优势。但实践中,推理的算术强度(arithmetic intensity)过低导致了 GPU 利用率严重不足。
| 模型 | 推理算法 | 算术强度(ops/byte) | GPU 利用率 |
|---|---|---|---|
| Transformer | attention (prefill) | ~100+ | 高 |
| Mamba1/2 | sequential scan | ~2.5 | 极低 |
| Mamba3 SISO | sequential scan | ~3 | 低 |
| Mamba3 MIMO | sequential scan | ~10+ | 中 |
当算术强度接近 2.5 ops/byte 时,GPU 计算单元大部分时间在等待内存数据到达(memory-bound)。推理时的 wall-clock 延迟受制于内存带宽,而非计算能力。这意味着理论上的 FLOPs 优势无法转化为实际加速。
综上所述,Mamba3 要解决三个核心问题:
连续时间 SSM 的核心是微分方程 x'(t) = A x(t) + B u(t)。在实际计算中,必须将其离散化为递归形式。离散化方法的精度直接影响模型在离散 token 序列上的表现。
Mamba1 和 Mamba2 都使用零阶保持(ZOH, Zero-Order Hold)离散化。ZOH 假设输入在采样间隔内保持恒定,精度为 O(Delta2)。更关键的是,Mamba1 的离散化公式在论文中是"启发式"给出的——它缺乏严格的理论证明,仅凭实验验证其可行性。
更重要的是,现代 SSM 是线性时变(LTV, Linear Time-Varying)系统:A_t, B_t 都随输入变化。对于 LTV 系统,经典的控制理论中没有成熟的高阶离散化方法——所有标准方法都假设系统是时不变的。这使得 Mamba1/2 的 ZOH 选择更像是一种"不得已而为之"。
论文提出的出发点是一个经典观察:对于纯线性系统 x'(t) = A x(t),其解为 x(t)=e^{tA}x(0)。对于一般的 x'(t) = A_t x(t) + B_t u(t),可以先将指数动力学因子化出来,然后再近似剩余积分项。
经典解为:
这里的关键洞察是:积分项中的指数 e^{(Δ-s)A_t} 仍然依赖于系统矩阵 A_t。如果对 整个被积函数做近似,而不是分段近似 B*u,可以得到更高精度。
论文首先提出了 Exponential-Euler 方法,其意义在于从理论上证明了 Mamba1/2 的离散化公式是合理的:
这种方法将积分项近似为矩形法则(取右端点),精度与 ZOH 同为 O(Delta2)。但它的理论框架更清晰,为后续推广到高阶方法铺平了道路。
Mamba3 的创新在于将矩形法则升级为梯形法则(Trapezoidal Rule):
其中 λt 是一个可学习的插值参数(由输入预测),控制前一步和当前步输入的混合比例。
精度分析:
这意味着对于相同的步长 Delta,梯形法的误差比 ZOH 小一个数量级。当 Delta 较小时(精细时序分辨率),这一精度提升尤为重要。
| 方法 | alpha_t | beta_t | gamma_t | 精度 | 使用 |
|---|---|---|---|---|---|
| ZOH | exp(Delta A) | -- | A-1(exp(Delta A)-I) | O(Delta2) | S4D, S5 |
| Exp-Euler | exp(Delta_t A_t) | -- | Delta_t | O(Delta2) | Mamba1/2 |
| Exp-Trapezoidal | exp(Delta_t A_t) | (1-lambda_t)Delta_t exp(Delta_t A_t) | lambda_t Delta_t | O(Delta3) | Mamba3 |
在 SSD(结构化状态空间对偶)框架下,Mamba3 的离散化导致了一个有趣的变化:结构化掩码 L 从单一衰减掩码变为两个掩码的 Hadamard 乘积:
其中 L_decay 是经典的指数衰减掩码(由 alpha_t 的累积乘积构成),而 L_conv 是一个双波段卷积掩码(two-band convolutional mask)——它来自梯形法则对相邻时间步的混合。这一结构在经验上替代了语言模型中的短因果卷积(short causal convolution),即 Mamba 块中的第一个一维卷积。这简化了架构设计,同时通过离散化机制本身就引入了局部上下文混合。
Mamba3 最引人注目的创新是将 SSM 的状态从实数扩展到复数域。这不是简单的维度加倍,而是引入了旋转动力学——状态向量可以在复平面上旋转:
这里 A 仍然控制衰减幅度(实数值),而 eiθ 项引入了一个与输入相关的相位旋转。状态更新变为:
其中 theta 由输入通过一个线性层预测(与 B、C、Delta 类似),实现了数据相关的旋转。
复数状态空间的威力在于:它等价于将旋转位置编码(RoPE)内化到了递归状态更新中。
回忆 RoPE 的工作原理:在注意力机制中,RoPE 对 query 和 key 的每个维度对应用一个旋转矩阵,使得点积结果编码了位置信息。旋转角度随位置线性增长。
在 Mamba3 中,eiθ 项在每一步对状态施加旋转。经过 t 步后,累积旋转角度为 Σ θi。由于 theta 由输入 xi 预测,这个旋转是数据相关的——不同输入序列会产生不同的旋转轨迹。
关键区别:
| 方法 | 旋转控制 | 含义 |
|---|---|---|
| RoPE(标准) | 位置索引 | 固定旋转角度,仅编码位置 |
| Mamba3 复数 SSM | 输入内容 | 数据相关旋转,同时编码内容和位置 |
| RoPE(数据相关变体) | 输入+位置 | 需要额外计算 |
复数状态空间的核心价值体现在状态追踪任务上。论文在多个合成任务上验证了这一点:
实验结果显示:
复数 SSM 的计算可以复用现有的 RoPE kernel。因为复数乘法 eiθ h 在笛卡尔坐标系下就是二维旋转:
这正是 RoPE 中使用的旋转矩阵。因此,Mamba3 的复数状态更新可以用高度优化的 RoPE 计算 kernel 实现,几乎零额外开销。
Mamba1 和 Mamba2 的 SSM 单元本质上是SISO(Single-Input Single-Output,单输入单输出)架构。在每个状态维度上,SSM 只接收一个标量输入,产生一个标量输出。
具体地,在状态更新中:
这意味着状态更新的运算量是 O(N)(每个维度一个乘加),而需要读写的数据量也是 O(N)。计算密度约 2.5 ops/byte,完全受内存带宽限制。
Mamba3 将 B 和 C 从向量扩展为矩阵:
其中 P 是并行输入/输出通道数。状态更新变为:
关键变化:
MIMO 的核心优势在于在不增加状态维度的前提下提升计算密度:
| 指标 | SISO (Mamba2) | MIMO (Mamba3) |
|---|---|---|
| B 形状 | RN | RN×P |
| C 形状 | RN | RN×P |
| 每步计算量 | O(N) | O(NP) |
| 每步数据访问 | O(N) | O(NP) |
| 算术强度 | ~2.5 ops/byte | ~Theta(R) ops/byte |
| 典型 GPU 利用率 | <10% | 30-50% |
MIMO 的 P 个并行通道可以理解为同一个状态向量通过 P 个不同的"视角"与输入交互。每个通道的 B、C 列可以捕获输入的不同特征模式,同时所有通道共享同一个状态 h_t。
这与 Transformer 的 multi-head attention 有异曲同工之处:
关键区别在于,Multi-head attention 的多个头各自有独立的上下文,而 MIMO SSM 的多个通道共享同一个状态向量,信息在通道之间自然交互。
论文在 1.5B 参数规模下对比了 Mamba3 与多个基线模型:
| 模型 | 平均下游性能提升 vs GDN 基线 | 备注 |
|---|---|---|
| Transformer (1.5B) | +1.5 | 原始 Transformer 基线 |
| Mamba2 (1.5B) | ~0 | 接近 GDN 基线 |
| Gated DeltaNet (GDN) | 0 (基线) | -- |
| Mamba3 SISO | +0.6 | vs GDN |
| Mamba3 MIMO | +1.8 | vs GDN |
Mamba3 MIMO 的 +1.8 平均提升说明:三个创新的叠加效果超出了单项相加。复数状态空间解决了能力短板(状态追踪),指数-梯形离散化提升了建模精度,MIMO 提升了计算效率——三者协同作用。
MIMO 的另一个重要发现是状态维度效率:
这意味着 Mamba3 可以用更小的状态维度达到相同的建模质量。更小的状态维度意味着:
| 任务 | Mamba2 | GDN | Mamba3(实数值) | Mamba3(复数值) | Transformer |
|---|---|---|---|---|---|
| 奇偶校验 | ~50% | ~50% | ~52% | ~99% | ~99% |
| 算术(加法) | 随机 | 随机 | 随机 | ~98% | ~99% |
| 选择性复制 | ~85% | ~88% | ~87% | ~99% | ~100% |
| 归纳头 | ~92% | ~94% | ~93% | ~98% | ~99% |
| 指标 | Mamba2 | Mamba3 SISO | Mamba3 MIMO (P=4) |
|---|---|---|---|
| 推理算术强度 | ~2.5 ops/byte | ~3 ops/byte | ~10 ops/byte |
| 解码 FLOPs | 1x | ~1.2x | ~4x |
| wall-clock 延迟 | 1x | ~1x | ~1x |
| GPU 利用率 | ~8% | ~10% | ~35% |
上表展示了一个反直觉但非常重要的结果:MIMO 的 FLOPs 增加了 4 倍,但 wall-clock 延迟几乎不变。这是因为原来的计算是内存受限的——GPU 计算单元大部分时间在等待数据。增加计算量(只要不增加内存访问)可以"填满"空闲的计算单元,实现零成本的额外计算。
在标准语言建模基准(如 Pile、WikiText-103)上,Mamba3 的困惑度持续优于 Mamba2,并且差距随序列长度增大:
这一趋势表明,指数-梯形离散化在长序列上的精度优势会累积。每一步的 O(Delta3) 精度虽然看似微小,但在数千步的累积下产生了显著的最终效果差异。
Mamba3 的开放问题:
Mamba3 最深的洞察是将位置编码内化到了递归动力学中。RoPE 本质上是在注意力空间中做旋转位置编码;Mamba3 的复数值状态则在隐藏状态空间中做旋转内容编码。
这个设计优雅之处在于:传统上位置编码和内容编码是正交的两个模块,而 Mamba3 将它们统一到了同一个递归框架中。位置信息不再需要额外的编码层,而是通过状态向量的自然旋转来携带。
Mamba3 的很多设计选择都透露着"推理优先"的思路:
在当前 Agentic AI 和推理时计算扩展的大趋势下,这种设计哲学显得尤其前瞻。推理成本正在成为大模型部署的主要瓶颈,针对推理优化的模型架构将获得巨大的竞争优势。
MIMO 的设计是一个反直觉但非常聪明的工程洞察:当计算是内存受限时,增加计算量可以免费获得更多信息处理能力。因为 GPU 计算单元大部分时间空闲,额外计算不会增加延迟。
这类似于"用 FLOPs 换精度"的策略——在内存带宽固定的前提下,充分利用空闲的计算资源做更多有用的计算。这一思路对未来的硬件-算法协同设计有启发意义:与其追求最小化 FLOPs,不如追求最大化每内存访问的有效计算量。
回顾 SSM 的发展:
三部曲的完成意味着 SSM 在质量、速度、能力三个维度上都达到了 Transformer 级别。但这不意味着 Transformer 的终结——相反,混合架构(SSM + Attention)可能是未来最务实的路径,因为两者各自有不可替代的优势领域:Attention 擅长任意长距离的精确检索,SSM 擅长高效的序列压缩和状态维护。