像物理学家一样修剪 LLM:将 Block 删除转化为优化问题
加速大型语言模型(LLM)最廉价且直接的方法之一是删除整个 Transformer 块。这种被称为“深度剪枝”的技术通过缩短模型结构,在节省内存的同时提供可预测的推理速度提升,并且能与量化、低秩压缩等技术叠加使用。然而,核心难点在于决定哪些块应当被移除。错误的选择会导致模型性能崩溃,且单个块的移除效果依赖于其他块是否同时被移除,这使得该问题具有组合性质而非简单的排序问题。这正是自旋系统物理学所擅长描述的领域。

Multiverse Computing 团队近期发表了一篇论文《LLM Compression by Block Removal with Constrained Binary Optimization》(通过受约束的二进制优化进行基于块移除的 LLM 压缩)。该研究将块选择重新定义为一个受约束的二进制优化 (CBO) 问题,并将其映射到一个伊辛玻璃模型——一种具有全对全相互作用和固定数量“向上”旋转的无序自旋系统。研究表明,这种自旋系统的能量是预测模型基准测试得分的有力且廉价的指标,这意味着无需运行基准测试即可对大量候选配置进行排名。实验结果显示,在 Llama-3.3-70B-Instruct 上实现 50% 压缩时,该方法在 MMLU 基准上获得了近 23 个百分点的提升。
为什么块移除是一个多体问题
现有的大多数块移除方法通常单独对每个块进行评分,然后利用大小、灵敏度或“块影响”等启发式规则移除看似最不重要的块。从物理学术语来看,这些属于平均场方法,它们假设每个块的贡献是独立的,类似于用单个平均场取代自旋邻居的作用。另一种常见的捷径是仅删除连续运行的块,这虽然简化了问题,但丢弃了大部分搜索空间。
然而,Transformer 中的块并非独立存在,就像磁铁中的自旋一样。删除第 20 块是否会损害模型性能,取决于是否同时删除了第 19 块或第 24 块。随着模型深度的增加和多样性的提高,忽视这些相互作用将危及模型质量。理想的做法是在考虑相互作用的同时搜索块的组合,但这导致配置数量呈指数级增长。统计物理工具正是为此类具有指数级大配置空间的联立二元变量问题而设计的。
核心思路:将块选择转化为能量最小化问题
研究人员为每个 Transformer 块附加一个二进制变量:0 表示保留,1 表示删除,类比于可以向下或向上指向的自旋。随后对这些变量进行二次泰勒展开,生成一个近似的 Hessian 矩阵。Hessian 的对角线元素代表每个块自身的重要性,而非对角线元素则捕捉了块之间的成对相互作用,从而超越了平均场方法的局限。
这一重构将“应该删除哪些块?”转化为一个清晰的优化目标:寻找一个包含 M 个块的集合,其删除操作能最小化能量 $x^T H x$,前提是总共删除 N 个块。从数学上看,这是一个受约束的二进制优化问题;从物理上看,它是一个伊辛玻璃模型,其中保留磁化强度对应于固定数量的被移除块。关键发现是,这种能量与下游任务的质量密切相关:自旋系统的低能量状态对应着高性能的剪枝模型。因此,最小化能量等同于最大化基准测试得分。
块选择成为一个受约束的二进制优化问题,相当于寻找伊辛玻璃的低能量状态;每个解决方案都指出了应从 N 个块中删除哪 M 个块。右图展示了如何通过在每个块的剩余路径中插入 α 混合变量来构建 Hessian。来源:论文图 1。
该方法的实用性主要源于其低成本特性。Hessian 矩阵(即全套相互作用项)只需在一个小型校准数据集上进行一次前向和后向传播即可计算得出,无需运行实际模型或进行基准测试。由于相互作用不依赖于具体的压缩目标,同一个 Hessian 可以重复用于解决不同 M 值的问题。
求解策略:精确求解与量子启发算法
对于大多数模型,配置空间虽然庞大但仍可检查。由于计算能量的成本极低,研究人员可以在单个 GPU 上强制计算数十亿种自旋配置。几百万种配置仅需几秒钟,而处理最复杂的案例——从 Llama-3.3-70B 的 80 个块中移除 8 个(约 29 亿种配置)——大约耗时两天。
当配置空间超出精确求解能力时,将问题视为伊辛玻璃的价值再次体现。在其对应的 QUBO 形式中(约束条件被吸收为惩罚项),相同的任务可以交给专为此类哈密顿量构建的高度优化的经典、量子或量子启发解法器,如模拟退火机、QAOA、禁忌搜索和专门的分支定界法。研究发现,一个开源的禁忌搜索解法器能在几秒钟内可靠地达到最低能量状态。这使得该方法能够扩展到无法穷举配置的更大模型中。
这里有一个微妙但重要的区别:通常 CBO 或回火解法器以找到真实基态作为评判标准,但该研究并不需要绝对的基态,只需要快速产生若干良好的低能量状态。这一较低的门槛使得轻量级解决方案变得非常有用。
低能频谱的整体重要性
能量虽然是质量的强大代理指标,但并不完美,因此单一的最低能量状态并不总是最佳模型。这被视为一个特性而非缺陷:一旦哈密顿量确定,读取基态和低激发态的成本几乎为零,从而提供一系列高质量的候选剪枝方案,而不是一个脆弱的单一答案。探索激发态本身也是活跃的物理研究领域。
具体案例显示:对于 Llama-3.1-8B-Instruct 在删除 16/32 个块时,大多数顶部状态都在模型末端切断块,符合先前工作的预期。但第 17 个激发态首次建议在模型开始处移除一个块,经过轻微重训练后,这种配置在多个基准测试中击败了基态。这直接反驳了“最好的剪枝方法是连续剪除中期或后期块”的普遍观点。
左图:前 20 个最低能量状态中被删除的块(红色=被删除)。右图:第 17 个激发态消除了早期块,在重新训练后在几个基准上击败了基态。最佳模型是激发态而非基态。来源:论文图 2。
实验结果
在 Llama-3.1-8B-Instruct、Qwen3-14B 和 Llama-3.3-70B-Instruct 上的测试表明,该方法 (CBO) 与最先进的块移除基线相当或更优,且随着压缩率的增加,优势愈发明显。
最显著的胜利出现在对 Llama-3.3-70B-Instruct 的深度压缩中。在 80 个块中删除 24 个时,CBO 与“块影响”方法表现大致相当。但在删除 32/80 和 40/80 个块的最深设置中,CBO 在 MMLU 上拥有近 23 分的优势。对于 Qwen3-14B,在删除 12/40 个块时,CBO 领先 MMLU 约 10 分。在较轻的压缩中,各方法表现可比,这符合预期:切割越深,相互作用越重要。
| Llama-3.3-70B-Instruct,无再训练 | 已移除的块 | MMLU |
|---|---|---|
| 原始模型 | 0 | 82.2 |
| CBO (本文方法) | 32 / 80 | 76.6 |
| Block Impact | 32 / 80 | 59.3 |
| CBO (本文方法) | 40 / 80 | 76.9 |
| Block Impact | 40 / 80 | 54.0 |
在 40/80 (50% 深度) 压缩下,CBO 的 MMLU 接近 77,而最强基线降至 50 多分。来源:论文表 2。
超越密集 Transformer 架构
在现代异构架构中,不同类型的块交错排列,使得块移除更加困难。但伊辛公式对此并不敏感:无论站点上的块类型如何,相互作用就是相互作用。为了进行压力测试,研究人员将该方法应用于 NVIDIA Nemotron-3-Nano-30B-A3B-FP8。
结果表明该方法可以直接迁移。通过去除 23 个 MoE 层或 2 个注意力层,CBO 发现了在 AIME25 和 GPQA 上击败“块影响”方法的配置。结果还证实了混合模型中存在真实的冗余,但分布不均:某些专家层比其他层更容易一次性使用,而该方法搜索组合配置空间的能力是找到良好切断点的原因。即使在此类模型中,来自密集模型的模式依然成立,最佳配置通常是激发态而非基态。
技术细节与开源信息
使用经典和量子启发的优化机器来解决此问题,完全契合 Multiverse Computing 的技术方向,也与其压缩堆栈(包括块移除、量化、低秩/SVD 压缩、宽度剪枝)的理念一致。
完整的技术细节,包括泰勒扩展推导、QUBO 映射及解法器基准测试,可在相关论文全文中查阅。代码已开源:github.com/CompactifAI/Block_removal_through_constrained_binary_optimization。





