23 · Mamba-3: Improved Sequence Modeling using State Space Principles

SSM STATES Lahoti et al. 2026
arXiv:2603.15569

Previous: Mamba2 sacrificed expressivity for efficiency -- can't do parity check (state tracking). Inference arithmetic intensity low (~2.5 ops/byte).

This: Three innovations: (1) Complex state space (rotation dynamics = data-dependent RoPE) solves state tracking. (2) Exponential-trapezoidal discretization O(Delta3). (3) MIMO multi-channel higher arithmetic intensity.

Effect: 1.5B model beats Transformer/Mamba2/GDN all baselines. MIMO variant half state dim matches Mamba2 perplexity.

一、核心背景

1.1 推理效率成为瓶颈

随着 Chain-of-Thought(CoT)、Agentic AI 等推理时计算扩展范式的兴起,模型推理效率已经从"锦上添花"变为"核心瓶颈"。Transformer 的推理成本随序列长度线性增长(KV cache),在 Agent 场景中模型需要反复读取完整上下文,内存带宽成为天花板。

SSM 家族(Mamba1, Mamba2, Gated DeltaNet)理论上拥有 O(1) 推理复杂度——固定大小的状态向量足以概括历史信息,无需 KV cache。这使它们在长序列推理场景中具有天然优势。

1.2 Mamba2 的效率-表达能力权衡

Mamba2 通过结构化状态空间对偶(SSD)框架大幅提升了训练效率:将 SSM 的递归计算重写为矩阵乘法,得以利用 GPU 张量核心。但这一简化付出了代价——状态表达能力被削弱了

关键证据是 状态追踪(state tracking)任务。例如奇偶校验(parity check):给定一个比特序列,判断其中 1 的个数是否为偶数。模型需要精确计数并记忆跨步的奇偶信息。Mamba2 在这类任务上表现极差(甚至接近随机猜测),而 Transformer 可以轻松解决。

状态追踪为何重要:这不仅是合成任务。代码中的括号匹配、算术中的进位传播、对话中的指代消解、路由中的状态维护,本质上都需要精确状态追踪能力。如果模型无法做到,在实际应用中会出现系统性的逻辑缺陷。

1.3 次二次模型的 GPU 利用率困境

理论上,次二次(sub-quadratic)模型拥有 O(1) 推理复杂度的优势。但实践中,推理的算术强度(arithmetic intensity)过低导致了 GPU 利用率严重不足。

模型推理算法算术强度(ops/byte)GPU 利用率
Transformerattention (prefill)~100+
Mamba1/2sequential scan~2.5极低
Mamba3 SISOsequential scan~3
Mamba3 MIMOsequential scan~10+

当算术强度接近 2.5 ops/byte 时,GPU 计算单元大部分时间在等待内存数据到达(memory-bound)。推理时的 wall-clock 延迟受制于内存带宽,而非计算能力。这意味着理论上的 FLOPs 优势无法转化为实际加速。

1.4 三大未解决问题

综上所述,Mamba3 要解决三个核心问题:

  1. 表达能力不足:SSM 无法做状态追踪、精确推理等 Transformer 擅长的任务
  2. 离散化粗糙:ZOH(零阶保持)离散化精度有限,在处理细粒度时序信号时信息损失
  3. 算术强度低:SISO 架构的推理算术强度仅 ~2.5 ops/byte,GPU 严重未充分利用

二、创新1: 指数-梯形离散化(Exponential-Trapezoidal Discretization)

2.1 Mamba1/2 离散化的问题

连续时间 SSM 的核心是微分方程 x'(t) = A x(t) + B u(t)。在实际计算中,必须将其离散化为递归形式。离散化方法的精度直接影响模型在离散 token 序列上的表现。

Mamba1 和 Mamba2 都使用零阶保持(ZOH, Zero-Order Hold)离散化。ZOH 假设输入在采样间隔内保持恒定,精度为 O(Delta2)。更关键的是,Mamba1 的离散化公式在论文中是"启发式"给出的——它缺乏严格的理论证明,仅凭实验验证其可行性。

更重要的是,现代 SSM 是线性时变(LTV, Linear Time-Varying)系统:A_t, B_t 都随输入变化。对于 LTV 系统,经典的控制理论中没有成熟的高阶离散化方法——所有标准方法都假设系统是时不变的。这使得 Mamba1/2 的 ZOH 选择更像是一种"不得已而为之"。

线性时变 vs 时不变:线性时不变(LTI)系统有成熟的离散化理论(ZOH、FOH、Tustin 变换)。但 LTV 系统中 A_t 每个时间步都在变化,经典离散化公式不成立。Mamba 系列是为 LTV 系统设计新的离散化框架。

2.2 指数调整框架(Exponential-Adjusted Framework)

论文提出的出发点是一个经典观察:对于纯线性系统 x'(t) = A x(t),其解为 x(t)=e^{tA}x(0)。对于一般的 x'(t) = A_t x(t) + B_t u(t),可以先将指数动力学因子化出来,然后再近似剩余积分项。

经典解为:

x(t+Δ) = e^{ΔA_t} x(t) + ∫0Δ e^{(Δ-s)A_t} B(t+s) u(t+s) ds

这里的关键洞察是:积分项中的指数 e^{(Δ-s)A_t} 仍然依赖于系统矩阵 A_t。如果对 整个被积函数做近似,而不是分段近似 B*u,可以得到更高精度。

2.3 Exponential-Euler 方法(理论化 Mamba1/2)

论文首先提出了 Exponential-Euler 方法,其意义在于从理论上证明了 Mamba1/2 的离散化公式是合理的

ht = exp(ΔtAt) · ht-1 + Δt · Bt · xt

这种方法将积分项近似为矩形法则(取右端点),精度与 ZOH 同为 O(Delta2)。但它的理论框架更清晰,为后续推广到高阶方法铺平了道路。

2.4 Exponential-Trapezoidal 方法(Mamba3 核心创新)

Mamba3 的创新在于将矩形法则升级为梯形法则(Trapezoidal Rule)

ht = exp(ΔtAt) · ht-1 + (1-λtt · exp(ΔtAt) · Bt-1 · xt-1 + λtΔt · Bt · xt
完整的指数-梯形离散化递归公式

其中 λt 是一个可学习的插值参数(由输入预测),控制前一步和当前步输入的混合比例。

精度分析:

这意味着对于相同的步长 Delta,梯形法的误差比 ZOH 小一个数量级。当 Delta 较小时(精细时序分辨率),这一精度提升尤为重要。

2.5 四种离散化方法对比

方法 alpha_t beta_t gamma_t 精度 使用
ZOH exp(Delta A) -- A-1(exp(Delta A)-I) O(Delta2) S4D, S5
Exp-Euler exp(Delta_t A_t) -- Delta_t O(Delta2) Mamba1/2
Exp-Trapezoidal exp(Delta_t A_t) (1-lambda_t)Delta_t exp(Delta_t A_t) lambda_t Delta_t O(Delta3) Mamba3
为什么 ZOH 需要矩阵求逆:ZOH 的积分需要计算 A-1(exp(Delta A)-I),这不仅计算量大,而且要求 A 可逆。Mamba 系列将 A 参数化为对角阵或标量后不再需要矩阵求逆——这是 Exp-Euler 和 Exp-Trapezoidal 能高效计算的工程基础。

2.6 SSD 框架下的结构化掩码

在 SSD(结构化状态空间对偶)框架下,Mamba3 的离散化导致了一个有趣的变化:结构化掩码 L 从单一衰减掩码变为两个掩码的 Hadamard 乘积

L = Ldecay ⊙ Lconv
Mamba3 SSD 掩码 = 衰减掩码 ⊙ 卷积掩码

其中 L_decay 是经典的指数衰减掩码(由 alpha_t 的累积乘积构成),而 L_conv 是一个双波段卷积掩码(two-band convolutional mask)——它来自梯形法则对相邻时间步的混合。这一结构在经验上替代了语言模型中的短因果卷积(short causal convolution),即 Mamba 块中的第一个一维卷积。这简化了架构设计,同时通过离散化机制本身就引入了局部上下文混合。

三、创新2: 复数值状态空间

3.1 从实数到复数

Mamba3 最引人注目的创新是将 SSM 的状态从实数扩展到复数域。这不是简单的维度加倍,而是引入了旋转动力学——状态向量可以在复平面上旋转:

Acomplex = A · e
复数状态转移矩阵:实数值衰减幅度 × 复数值旋转

这里 A 仍然控制衰减幅度(实数值),而 e 项引入了一个与输入相关的相位旋转。状态更新变为:

ht = (A · e) · ht-1 + B · xt
复数 SSM 状态更新

其中 theta 由输入通过一个线性层预测(与 B、C、Delta 类似),实现了数据相关的旋转

3.2 复数值状态 = 数据相关的 RoPE

复数状态空间的威力在于:它等价于将旋转位置编码(RoPE)内化到了递归状态更新中

回忆 RoPE 的工作原理:在注意力机制中,RoPE 对 query 和 key 的每个维度对应用一个旋转矩阵,使得点积结果编码了位置信息。旋转角度随位置线性增长。

在 Mamba3 中,e 项在每一步对状态施加旋转。经过 t 步后,累积旋转角度为 Σ θi。由于 theta 由输入 xi 预测,这个旋转是数据相关的——不同输入序列会产生不同的旋转轨迹。

关键区别:

方法旋转控制含义
RoPE(标准)位置索引固定旋转角度,仅编码位置
Mamba3 复数 SSM输入内容数据相关旋转,同时编码内容和位置
RoPE(数据相关变体)输入+位置需要额外计算

3.3 状态追踪能力

复数状态空间的核心价值体现在状态追踪任务上。论文在多个合成任务上验证了这一点:

实验结果显示:

3.4 高效计算

复数 SSM 的计算可以复用现有的 RoPE kernel。因为复数乘法 e h 在笛卡尔坐标系下就是二维旋转:

(Re(h') + i·Im(h')) = (cos θ + i·sin θ) · (Re(h) + i·Im(h))
= (Re(h)·cos θ - Im(h)·sin θ) + i·(Re(h)·sin θ + Im(h)·cos θ)

这正是 RoPE 中使用的旋转矩阵。因此,Mamba3 的复数状态更新可以用高度优化的 RoPE 计算 kernel 实现,几乎零额外开销。

实现细节:实际实现中,复数状态不是显式用复数类型存储的,而是用一对实数向量分别表示实部和虚部。旋转操作通过点积计算完成,与 RoPE 的实现方式完全一致。

四、创新3: MIMO 多通道 SSM

4.1 SISO 的问题:低算术强度

Mamba1 和 Mamba2 的 SSM 单元本质上是SISO(Single-Input Single-Output,单输入单输出)架构。在每个状态维度上,SSM 只接收一个标量输入,产生一个标量输出。

具体地,在状态更新中:

这意味着状态更新的运算量是 O(N)(每个维度一个乘加),而需要读写的数据量也是 O(N)。计算密度约 2.5 ops/byte,完全受内存带宽限制

4.2 MIMO 方案:从外积到内积

Mamba3 将 B 和 C 从向量扩展为矩阵

B: RN×P,   C: RN×P
MIMO: B 和 C 变为矩阵,P 为并行通道数

其中 P 是并行输入/输出通道数。状态更新变为:

ht = A · ht-1 + Σp=1P B:,p · xt,p
yt,p = C:,pT · ht
MIMO 状态更新:P 个并行通道的输入同时更新状态

关键变化:

4.3 算术强度分析

MIMO 的核心优势在于在不增加状态维度的前提下提升计算密度

指标SISO (Mamba2)MIMO (Mamba3)
B 形状RNRN×P
C 形状RNRN×P
每步计算量O(N)O(NP)
每步数据访问O(N)O(NP)
算术强度~2.5 ops/byte~Theta(R) ops/byte
典型 GPU 利用率<10%30-50%
算术强度解释:算术强度 = 计算量(FLOPs)/ 内存访问量(bytes)。当算术强度高时,GPU 的计算单元可以持续工作而不必等待内存数据。P 越大,每个状态更新中做的计算越多(相对于读写量),算术强度越高。在内存带宽成为瓶颈的推理场景中,更高的算术强度意味着更好的硬件利用率。

4.4 MIMO 的物理含义

MIMO 的 P 个并行通道可以理解为同一个状态向量通过 P 个不同的"视角"与输入交互。每个通道的 B、C 列可以捕获输入的不同特征模式,同时所有通道共享同一个状态 h_t。

这与 Transformer 的 multi-head attention 有异曲同工之处:

关键区别在于,Multi-head attention 的多个头各自有独立的上下文,而 MIMO SSM 的多个通道共享同一个状态向量,信息在通道之间自然交互。

五、实验结果

5.1 下游任务评估

论文在 1.5B 参数规模下对比了 Mamba3 与多个基线模型:

模型平均下游性能提升 vs GDN 基线备注
Transformer (1.5B)+1.5原始 Transformer 基线
Mamba2 (1.5B)~0接近 GDN 基线
Gated DeltaNet (GDN)0 (基线)--
Mamba3 SISO+0.6vs GDN
Mamba3 MIMO+1.8vs GDN

Mamba3 MIMO 的 +1.8 平均提升说明:三个创新的叠加效果超出了单项相加。复数状态空间解决了能力短板(状态追踪),指数-梯形离散化提升了建模精度,MIMO 提升了计算效率——三者协同作用。

5.2 状态维度效率

MIMO 的另一个重要发现是状态维度效率

Mamba3 MIMO (N=64) ≈ Mamba2 (N=128) 在同等困惑度
一半的状态维度,相同的困惑度质量

这意味着 Mamba3 可以用更小的状态维度达到相同的建模质量。更小的状态维度意味着:

5.3 状态追踪任务

任务Mamba2GDNMamba3(实数值)Mamba3(复数值)Transformer
奇偶校验~50%~50%~52%~99%~99%
算术(加法)随机随机随机~98%~99%
选择性复制~85%~88%~87%~99%~100%
归纳头~92%~94%~93%~98%~99%
关键发现:复数值状态是解决状态追踪的关键,而不是梯形离散化或 MIMO。上表显示,即使启用梯形离散化和 MIMO,如果不使用复数值状态,Mamba3 在状态追踪任务上仍然几乎随机。复数状态空间是这三项创新中最关键的突破

5.4 推理效率

指标Mamba2Mamba3 SISOMamba3 MIMO (P=4)
推理算术强度~2.5 ops/byte~3 ops/byte~10 ops/byte
解码 FLOPs1x~1.2x~4x
wall-clock 延迟1x~1x~1x
GPU 利用率~8%~10%~35%

上表展示了一个反直觉但非常重要的结果:MIMO 的 FLOPs 增加了 4 倍,但 wall-clock 延迟几乎不变。这是因为原来的计算是内存受限的——GPU 计算单元大部分时间在等待数据。增加计算量(只要不增加内存访问)可以"填满"空闲的计算单元,实现零成本的额外计算

5.5 语言建模困惑度

在标准语言建模基准(如 Pile、WikiText-103)上,Mamba3 的困惑度持续优于 Mamba2,并且差距随序列长度增大:

这一趋势表明,指数-梯形离散化在长序列上的精度优势会累积。每一步的 O(Delta3) 精度虽然看似微小,但在数千步的累积下产生了显著的最终效果差异。

六、上下游关联

6.1 时间线

6.2 与 Mamba1/2 的关系

6.3 论文贡献总结

6.4 后续方向

Mamba3 的开放问题:

七、个人思考

7.1 复数值状态:RoPE 的递归形式

Mamba3 最深的洞察是将位置编码内化到了递归动力学中。RoPE 本质上是在注意力空间中做旋转位置编码;Mamba3 的复数值状态则在隐藏状态空间中做旋转内容编码。

这个设计优雅之处在于:传统上位置编码和内容编码是正交的两个模块,而 Mamba3 将它们统一到了同一个递归框架中。位置信息不再需要额外的编码层,而是通过状态向量的自然旋转来携带。

7.2 "推理优先"的设计哲学

Mamba3 的很多设计选择都透露着"推理优先"的思路:

在当前 Agentic AI 和推理时计算扩展的大趋势下,这种设计哲学显得尤其前瞻。推理成本正在成为大模型部署的主要瓶颈,针对推理优化的模型架构将获得巨大的竞争优势。

7.3 MIMO:通过增加计算来获得效率

MIMO 的设计是一个反直觉但非常聪明的工程洞察:当计算是内存受限时,增加计算量可以免费获得更多信息处理能力。因为 GPU 计算单元大部分时间空闲,额外计算不会增加延迟。

这类似于"用 FLOPs 换精度"的策略——在内存带宽固定的前提下,充分利用空闲的计算资源做更多有用的计算。这一思路对未来的硬件-算法协同设计有启发意义:与其追求最小化 FLOPs,不如追求最大化每内存访问的有效计算量

7.4 Mamba3 三部曲的完成

回顾 SSM 的发展:

三部曲的完成意味着 SSM 在质量、速度、能力三个维度上都达到了 Transformer 级别。但这不意味着 Transformer 的终结——相反,混合架构(SSM + Attention)可能是未来最务实的路径,因为两者各自有不可替代的优势领域:Attention 擅长任意长距离的精确检索,SSM 擅长高效的序列压缩和状态维护。

7.5 开放问题