← 返回 2026-09-22 简报

像物理学家一样剪枝大语言模型:将块移除视为伊辛优化问题

Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem

语音播报
摘要
事件:Hugging Face团队将大模型块移除重构为伊辛玻璃优化问题,通过约束二进制优化选择需删除的Transformer模块。 要点:利用二阶泰勒展开构建耦合矩阵,能量值作为性能代理指标。在Llama-3.3-70B压缩50%时,MMLU提升近23个百分点。 影响:该方法无需逐次基准测试即可高效搜索最优剪枝组合,显著加速深度压缩场景下的模型推理并降低资源消耗。

让大语言模型运行得更快的一种最廉价方法,也是最粗暴的方法:删除整个 Transformer 模块。因为模型在物理意义上变短了,

块移除(也称为深度剪枝)在节省内存的同时带来了可预测的推理加速,并且它可以与量化、低秩压缩以及其他技术无缝结合。难点在于决定

要切除哪些模块。如果切错了,模型就会崩溃;而且删除任何一个模块的影响取决于你同时删除了哪些其他模块,因此这些选择是相互作用的。这使得它成为一个组合问题,而非排序问题,而具有相互作用二元变量的组合问题正是自旋系统的物理学所擅长描述的对象。

我们最新的论文《通过受约束的二元优化进行 LLM 压缩》(LLM Compression by Block Removal with Constrained Binary Optimization)将这种对应关系付诸实践。我们将块选择重新表述为受约束的二元优化(CBO)问题,该问题直接映射到伊辛玻璃态(Ising glass),这是一种具有全连接相互作用和固定数量“向上”自旋的无序自旋系统。该自旋系统的能量被证明是剪枝模型在基准测试中实际得分的一个强大且廉价的代理指标,这意味着我们可以对大量候选配置进行排名,而无需对其中任何一个进行基准测试,并将困难实例交给我们在 Multiverse 其他地方使用的相同经典和类量子求解器。在深度压缩领域,回报巨大:在对 Llama-3.3-70B-Instruct 进行 50% 压缩时,我们在 MMLU 上比最佳竞争的块移除方法提高了近 23 个百分点。

为什么选择模块是一个多体问题

大多数现有的块移除方法单独评估每个模块,然后移除那些看起来最不重要的模块,使用幅度、敏感性或“块影响”启发式方法。在物理学术语中,这些是平均场方法:它们将每个模块视为其贡献独立于其他模块,就像平均场理论用单个平均场替换自旋的邻居一样。一个相关的捷径是仅删除连续的一段模块,这使问题保持较小,但丢弃了大部分搜索空间。

麻烦在于,模块并非相互独立,正如真实磁铁中的自旋并非相互独立一样。删除第 20 个模块是否损害模型,取决于你是否也删除了第 19 个或第 24 个模块,这是两个决策之间的相互作用,或耦合。随着模型变得更深且更异构,忽略这些耦合会导致质量损失,尤其是当你希望一次性删除大量模块时。你真正想要的是在考虑模块如何相互作用的情况下搜索模块组合,但组合的数量呈指数级增长,因此暴力求解看起来毫无希望。这正是统计物理工具大显身手的领域:具有成对耦合的指数级大的配置空间。

想法:将块选择转化为能量最小化问题

我们为每个 Transformer 模块附加一个二元变量:0 表示保留它,1 表示删除它,就像可以指向下或上的自旋一样。然后我们对模型损失关于这些变量进行二阶泰勒展开,从而产生(近似)海森矩阵。该海森矩阵的对角线表示每个模块单独的重要性;非对角线元素正是模块之间的成对耦合,即平均场方法所丢弃的多体物理。

这种重构将“我应该移除哪些块?”转化为一个清晰的优化问题:在恰好移除 N 个块中的 M 个块的约束下,找到一组 M 个块,使其移除后的能量 xᵀH⁰x 最小化。从数学上看,这是一个受约束的二元优化问题;从物理角度看,它是一个自旋玻璃(Ising glass),即一个具有守恒磁化强度(固定数量的被移除块扮演了固定总自旋的角色)的全耦合自旋系统。我们确立的关键性质是,这种能量是下游质量的强代理指标:自旋系统的低能态对应于高性能的剪枝模型。最小化能量和最大化基准分数变成了同一个搜索过程。

块的选择成为一个受约束的二元优化问题,等同于寻找自旋玻璃的低能态;每个解指出要删除 N 个块中的哪 M 个。右图:我们插入到每个块残差路径中以构建海森矩阵(Hessian)的耦合变量 α。来源:论文图 1。

这之所以具有实用性,原因在于成本。海森矩阵,即完整的耦合集合,仅通过在小规模校准数据集上进行前向和反向传播计算一次。此后,评估任何候选配置只需进行一次廉价的能量计算,无需运行实际模型,更不用说对其进行基准测试了。而且由于耦合不依赖于压缩目标,同一个海森矩阵可以重复使用来解决许多不同的 M 值。

求解方法:条件允许时求精确解,否则使用量子或类量子求解器

对于大多数模型而言,配置空间虽然庞大但仍可检查。由于计算一次能量非常便宜,我们在单个 GPU 上进行暴力搜索,检查多达数百亿个自旋配置。几百万个配置只需几秒钟;此处最难的可行案例是移除 Llama-3.3-70B 的 80 个块中的 8 个(约 290 亿个配置),耗时大约两天。

超出这个范围,精确方法就会失效,而将问题表述为自旋玻璃的优势在此时再次显现。在其等效的二次无约束二元优化(QUBO)形式中(约束被吸收进惩罚项),完全相同的任务可以交给为此类哈密顿量构建的高度优化的经典、量子和类量子求解器,即量子退火、QAOA、禁忌搜索以及专门的分支定界法。我们发现,开源的禁忌求解器能够在几秒钟内可靠地达到最低能量状态,即使在我们能够通过暴力搜索进行验证的最难案例中也是如此。因此,该方法可以扩展到无法枚举配置的模型,使用那些 squarely 处于 Multiverse 领域内的求解器。

这里有一个微妙但重要的观点,它与优化的常规思路背道而驰。通常,CBO 或退火求解器的评判标准是它是否找到了真正的基态(ground state)。我们实际上并不需要基态。我们需要的是快速生成少量良好低能态的方法,这是一个容易得多的目标,这就是为什么轻量级求解器对我们如此有效,以及为什么我们可以负担得起运行多个求解器的原因。

为何整个低能谱都至关重要

能量是质量的强代理指标,但并非完美指标,因此单一最低能量状态并不总是最好的模型。事实证明,这是一个特性而非缺陷:一旦哈密顿量设置完毕,读取基态和低激发态几乎是免费的,从而提供了一系列高质量的候选剪枝方案供尝试,而不是一个脆弱的单一答案。探索激发态而不仅仅是基态本身就是物理学研究的一个活跃领域,并且完美映射到从业者在此处真正需要的内容。

一个具体的例子:对于 Llama-3.1-8B-Instruct,在移除 16/32 个块时,大多数低能态倾向于移除模型末尾的块,这符合先前工作的预期。但是,第 17 个激发态是第一个提出移除模型开头附近块的配置,经过轻度重新训练后,该配置在多个基准测试中均优于基态(ground state)。这直接驳斥了“最佳剪枝是中间或靠后的连续块”这一常见假设,并展示了尊重问题的完整多体结构为何能带来收益。

左图:20 个最低能态各自移除的块(红色 = 被移除)。右图:第 17 个激发态,通过移除早期块,在重新训练后于多个基准测试中击败基态。最佳模型是一个激发态,而非基态。来源:论文图 2。

结果

在 Llama-3.1-8B-Instruct、Qwen3-14B 和 Llama-3.3-70B-Instruct 上,我们的方法(CBO)与最先进的块移除基线持平或更优,且随着压缩变得更加激进,这一优势差距进一步扩大。

最显著的胜利在于对 Llama-3.3-70B-Instruct 的深度压缩评估,且未进行重新训练。在最多移除 80 个块中的 24 个时,CBO 与 block influence(块影响力)大致持平。但在移除 32/80 和 40/80 个块时,它确立了决定性优势,在最深的设置下 MMLU 领先基线近 23 分,并在我们测试的所有基准测试中均优于基线。对于 Qwen3-14B,在移除 12/40 个块时,CBO 在 MMLU 上领先约 10 分。在较轻的压缩程度下,各方法表现相当,这是预期的:耦合(couplings)在你深入剪枝时最为重要。

Llama-3.3-70B-Instruct,无重新训练
移除块数 | MMLU
---|---
原始模型 | 0 | 82.2
CBO (ours) | 32 / 80 | 76.6
Block influence | 32 / 80 | 59.3
CBO (ours) | 40 / 80 | 76.9
Block influence | 40 / 80 | 54.0

在移除 40/80(50% 深度)时,CBO 将 MMLU 维持在 77 左右,而最强的基线则跌至 50 多分。来源:论文表 2。

其泛化能力超越稠密 Transformer

在现代异构架构上,块移除变得更加困难,因为不同类型的块是交错排列的,而 Ising 公式并不在意这一点:无论每个位置是什么类型的块,耦合就是耦合。为了对此进行压力测试,我们将该方法应用于 NVIDIA-Nemotron-3-Nano-30B-A3B-FP8,这是一个混合模型,它以非均匀模式交错排列 Mamba2、注意力(attention)和混合专家(MoE)层,且未进行任何重新训练。

我们的公式没有任何关于同质堆栈的假设,因此可以直接迁移。在移除 2–3 个 MoE 层或 2 个注意力层的情况下,CBO 找到的配置在 AIME25 和 GPQA 上击败了 block influence。结果还证实了这些混合模型中的冗余确实是真实存在的,但分布不均:某些专家层比其他层更易于舍弃,而该方法能够搜索耦合配置空间的能力正是其定位优质剪枝位置的关键。即使在这里,来自稠密模型的规律依然成立:最佳配置通常是一个激发态,而非基态。

为何这契合 Multiverse Computing 的理念

将混乱的机器学习问题重构为 Ising 哈密顿量,然后使用为物理学构建的经典和类量子优化机器来求解,这正是 Multiverse 的核心专长所在,这也正是贯穿我们压缩栈的相同直觉。块移除可以与该栈的其他部分(量化、低秩/SVD 压缩、宽度剪枝以及基于知识蒸馏的修复)组合,因此它融入的是一个更大的流水线,而非与之竞争。

想要获取完整的技术细节,包括泰勒展开推导、QUBO 映射、求解器基准测试、校准数据集消融实验以及完整的結果表格?请在 Hugging Face 上阅读完整论文,或联系我们的团队探讨将此应用于您自己的模型。代码已在 github.com/CompactifAI/Block_removal_through_constrained_binary_optimization 开源。

本条评分 10.5 score-v1
  • 来源权威 8
    注册表 priority=8(Hugging Face)
  • 时效 2.534
    发布 8.8 小时前,衰减到 2.53/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-22 · 10.53 分

原文链接:https://huggingface.co/blog/MultiverseComputingCAI/pruning-llms-like-a-physicist-block-removal-as-an
来源:Hugging Face
以上内容由 AI 自动翻译,仅供参考。
← 返回简报