TL;DR
- 突破零阶优化瓶颈:在预训练 Transformer 语言模型领域,研究人员提出了名为“Dust”的零阶方法。该方法通过在每个 token 上独立扰动激活值(节点扰动),将每个 token 视为虚拟群体成员,仅需单次前向传播即可并行评估。
- 性能超越反向传播:实验显示,在大群体规模下,Dust 在多个设置中的表现甚至超过了传统的反向传播算法。这表明在算力充裕的场景中,基于搜索的方法有望取代反向传播。
- 效率提升数个数量级:Dust 的效率远高于权重空间进化策略(ES)。据推断,其效率比 EGGROLL 的 Transformer 实现高出 $10^3$ 到 $10^4$ 倍。
- 大模型更适应零阶方法:传统观点认为零阶方法难以扩展至大型网络,但研究发现较大的模型对种群规模的利用效率更高。例如,一个 243M 参数的模型在大多数种群大小下的表现优于小 120 倍的模型。
- 梯度估计对齐度随规模提升:随着种群增长,Dust 的梯度估计与反向传播梯度的对齐程度更好,且在测试的所有尺度上均保持良好对齐。
1 引言:从反向传播到暴力计算
深度学习长期依赖反向传播(Backprop)作为核心信用分配算法,包括现代基于 Transformer 的语言模型。反向传播要求模型具备可微性并产生一阶梯度,现有的架构、优化器和硬件均围绕这一约束演化。

然而,随着全球算力的激增,业界开始探索更通用、依赖暴力计算的机器学习算法,以摆脱对可微性和高阶梯度近似等归纳偏置的依赖。Sutton 提出的“苦涩教训”指出,能随算力扩展而提升性能的通用方法最终会胜出,AlphaGo Zero 便是典型案例:在低算力环境下,可微性有助于学习效率;但在高算力环境下,它限制了架构探索空间。即便在同一架构内,基于梯度的方法也无法最优地探索损失景观,这可能解释了当前神经网络为何需要海量数据才能泛化。一种基于搜索的、更具灵活性的信用分配算法,被视为改善泛化能力的关键一步。
本文介绍的 Dust 算法旨在用更少依赖解析结构、更多依赖暴力计算的算法取代反向传播。作为一种零阶优化算法,Dust 通过扰动激活值并根据其对损失函数的降低程度给予奖励,在群体中平均这些奖励加权后的扰动来估计梯度。与传统通过扰动权重的进化策略(ES)不同,Dust 引入了“虚拟群体”概念:完全绕过权重空间,转而扰动激活值,从而避免为每个成员实例化权重。由于在每个 token 上独立执行此操作,单次前向传播即可并行评估所有成员。
激活值是一个比权重更具潜力的搜索空间。机械解释性研究表明,推理存在于激活值中,可表达的形式构成了全局工作空间。这意味着该方法可以将训练转化为对潜在推理的探索。通过将激活空间扰动与通用的信用分配规则配对,Dust 实现了高效的梯度估计。
主要贡献:
- 首次提出在预训练 Transformer 语言模型中与反向传播竞争的零阶方法。在大群体中,Dust 在多个设置中超越反向传播。
- 效率比重空间 ES 高出数量级,比 EGGROLL 的 Transformer 实现效率高 $10^3$ 到 $10^4$。
- 挑战传统观点,证明较大模型通常对种群效率更高,为过度参数化提供了新视角。
- 随着群体增长,Dust 的梯度估计与反向传播更好地对齐。
注:本研究旨在为基于搜索的信用分配算法奠定基础,并未尝试使其计算效率足以完全取代当前的反向传播,也未涉及训练如循环外部程序网络等新型架构。
2 方法原理
Dust 的核心机制如下:向每个线性层的输出添加高斯噪声,且独立作用于每一个 token,进行前向传递。按奖励加权的噪声平均值即为层输出的估计误差,该误差与层输入的外积构成权重梯度。内部层通过对当前和未来 token 的注意力输出估计误差获得信用,而非直接来自 token 的损失。直观而言,虽然权重空间 ES 每次前向传递仅评估一个群体成员,但 Dust 通过向隐藏状态添加噪音,实现了每个 token 作为一个成员,单次前向传递评估的群体规模至少是权重空间 ES 的三倍。
2.1 激活空间扰动与虚拟群体
进化策略的主要瓶颈在于种群数量,因为每个成员都需要独立的权重和前向传递。EGGROLL 虽然使副本成本降低,但每个成员仍受限于一次前向传递的成本。Dust 通过在每个 token 上独立扰动激活值来解决这一问题。在这种模式下,网络表现得好像已对产生该激活值的层权重应用了低阶扰动,尽管这种扰动从未在权重中实际实现。这被称为“虚拟群体”。Transformer 序列包含数千个 token,因此单次前向传递即可评估数千个成员,而非仅仅一个。除了残留混合标量器通过普通权重空间 ES 训练外,模型中的每个权重都以此方式训练。
对激活值而非权重添加噪声属于节点扰动。对于具有大量跨 token 激活值的 Transformer 模型,单个序列上的噪声张量条目数一旦超过输入维度,便至少与权重矩阵一样多。通过采用逐 token 独立的扰动和奖励,Dust 在 token 轴上形成了一个高效的新群体,这与 EGGROLL 依赖的 batch 轴正交。
2.2 信用分配机制
对于线性层 $y_t = W x_t$,Dust 在所有 token 上将输出扰动为 $y_t + \sigma a_t$,其中 $a_t \sim \mathcal{N}(0,I)$,$\sigma$ 为噪声尺度。针对每个 token $s$,计算中心损失减少量 $c_s = \tilde{\ell}_s - \ell_s$。Token $t$ 的奖励由自身及后续 token 的损失减少量加权求和得到:
$$r_t = \sum_{s \ge t} \gamma^{\,s-t} c_s .$$当 $\gamma=0$ 时,动作仅通过其自身的 token 获得奖励。通过平均 $K$ 次抽样的奖励加权噪声,得到层输出的估计误差:
$$\hat g_t = -\frac{1}{K\sigma}\sum_{i=1}^{K} r_t^{(i)} a_t^{(i)}.$$该估计误差与层输入的外积加上 token 项,即构成权重梯度:
$$\widehat{G}_W = \sum_t \hat g_t\, x_t^\top .$$对于嵌入层,由于输入是单热编码,外积表现为将 $\hat g_t$ 散射加到对应的 token 行中。随着种群无限增长,扰动消失,估计器收敛于真实梯度。
2.3 干扰调节与超参数优化
为了减少有限种群下的干扰,Dust 采取三种策略:首先,不同类型的层在不同的前向传递中分离扰动,利用缓存清洁的前向传递,仅重复特定块的计算;其次,注意力内部组件(查询、键、值等)单独扰动,并通过注意力输出获得奖励;最后,语言建模头直接在缓存逻辑上扰动,仅重新评估交叉熵,允许运行更大的种群。
注意力内部的信用评分通过以下公式计算:
$$c_s = -\langle \hat g_s, \Delta o_s \rangle ,$$其中 $\Delta o_s$ 是扰动引起的注意力输出变化。
超参数(噪声尺度、信用衰减、种群份额)可通过网格搜索最大化估计梯度与反向传播梯度之间的余弦相似度来确定。这种方法发现的最优设置在跨越不同 token 预算和种群规模时具有泛化性。实验表明,除键、值、门控和值嵌入外,其他层不需要来自未来 token 的信用,后者的衰减系数接近 1。
3 训练效果对比
3.1 实验设置
研究团队在 FineWeb 数据集上使用 BPE tokenizer(4096 tokens),以 SGD 恒定学习率训练 GPT 型 Transformer。基础模型包含 8 层,宽度 512。对比对象包括 Dust、反向传播(Backprop)以及权重空间基线 EGGROLL。验证集和测试集均为每组 544 个序列的持久集。
3.2 主要成果
实验将 token 预算从 10 万增加到 2000 万,种群规模从 64 增加到 16k。结果显示:
- 小预算阶段:在 100k 和 1M token 下,Dust 的表现略逊于或接近反向传播。
- 大预算阶段:在 10M 和 20M token 下,随着种群规模扩大,Dust 与反向传播的差距缩小。在 10M 处,Dust 的性能平台期落在反向传播之上。在 20M 处,Dust 在 16k 种群下仍在下降,其拟合极限(4.431)低于反向传播的 4.633,表明差距随种群增加而持续缩小。
- 效率对比:权重空间 ES(EGGROLL)效率显著较低。即使拥有 256 倍种群,16k 的 EGGROLL 仍未达到 64 种群的 Dust 水平。要匹配 Dust 的最小种群效果,EGGROLL 需要约 $10^4$ 倍的计算资源。
3.3 Adam 优化器下的表现
在使用 Adam 优化器的 1M token 实验中,EGGROLL 几乎没有从 Adam 中获得收益,其调整后的曲线与 SGD 几乎一致。然而,Adam 改进了 Dust 和反向传播的表现。Dust 在大种群下再次超越反向传播,其极限置信区间位于反向传播之下。尽管现代优化器主要针对反向传播梯度设计,但 Dust 与优化器的共同进化可能带来进一步收益。
4 高维空间搜索特性
4.1 过度参数化的优势
传统观点认为零阶方法无法训练大型网络,因为梯度估计方差随扰动维度增加而增大。然而,通过测试 2M、7M、38M 和 243M 四种规模的模型(固定 10M token 预算),研究发现:
- 大模型更高效:较大的模型对种群效率更高。即使在最小种群中,243M 模型也能媲美小得多的模型,而在大种群中表现更好。
- 收益差异:38M 和 243M 模型随种群增加的收益比 2M 和 7M 模型大约多 30%。
这表明应将模型大小视为搜索空间的大小和几何形状。更大的模型提供了更大的搜索空间和潜在的更优损失景观几何,使得搜索更有效。
4.2 梯度对齐现象
研究测量了 Dust 估计梯度与反向传播梯度之间的余弦相似度。数据显示,在训练的每个阶段和每种层类型中,余弦相似度随种群规模增加而上升,符合规律:
$$\cos(K) = \frac{c_{\max}}{\sqrt{1 + c/K}}$$这意味着有用的梯度仅从大种群中出现,无需内置链式法则,只需轻微调整超参数以最大化余弦相似度。





