超大规模进化策略 Evolution Strategies at the Hyperscale

发布时间:2026/7/28 2:40:11

超大规模进化策略 Evolution Strategies at the Hyperscale 摘要1 引言进化策略ESRechenberg, 1978Beyer, 1995Beyer Schwefel, 2002是相对于基于梯度反向传播的一阶方法的一个有吸引力的替代方案原因有几点。首先ES 不需要可微性因此可以优化更广泛的模型类别例如具有离散参数化空间的模型元胞自动机并且可以优化梯度不可用或带有噪声的目标如大语言模型微调中的仅结果奖励Qiu et al., 2025。其次ES 对噪声和病态优化景观更具鲁棒性Wierstra et al., 2011Xue et al., 2021。与梯度不同基于种群的探索可以平滑不规则性Salimans et al., 2017容忍不连续性并缓解长期或循环设置中的病态曲率或梯度消失和爆炸等问题Hansen, 2023。第三ES 非常易于通过并行化进行扩展因为适应度评估在种群成员之间是独立的且仅需通信标量适应度这清晰地映射到现代推理基础设施并在大型集群上实现近线性加速Salimans et al., 2017。相比之下反向传播需要在设备间通信和聚合梯度带来高昂的内存和计算成本。此外在使用低精度数据类型训练模型时反向传播需要特别小心而 ES 可以直接优化任何在推理时使用相同数据类型的模型。这些特性共同使 ES 成为训练大型、离散或混合架构以及具有不可微组件的端到端系统包括大语言模型LLMsBrown et al., 2020Chowdhery et al., 2023Du et al., 2022Fedus et al., 2022的潜在强大基础。尽管具有这些潜力但大规模应用 ES 存在实际障碍。在深度学习架构Goodfellow et al., 2016中大部分可训练参数形成了由矩阵表示的线性映射Rosenblatt, 1962Hochreiter Schmidhuber, 1996Bengio et al., 2000Krizhevsky et al., 2012Goodfellow et al., 2014Kingma Welling, 2014Vaswani et al., 2017因此朴素地应用 ES 需要生成全秩矩阵扰动为每个种群成员复制整个参数集。这膨胀了内存成本并迫使大型权重张量频繁移动。评估这些扰动然后需要为每个成员分别进行矩阵乘法序列因此总计算量和挂钟时间大致随种群规模和序列长度扩展。在十亿参数规模下这两项成本占主导地位使得将 ES 扩展到小模型或小种群之外变得困难Qiu et al., 2025Korotyshova et al., 2025。2 预备知识本文所有理论结果的证明见附录。2.1 低秩矩阵逼近2.2 高斯矩阵分布与矩阵范数2.3 进化策略2.4 高斯矩阵 ES我们指出对于高斯种群分布式(4)中的进化策略ES更新与自然进化策略NES更新仅相差一个σ²因子。NESWierstra et al., 2008; 2011的更新遵循式(1)中目标函数的自然梯度Amari, 1998; Kakade, 2001。这意味着在我们的问题设定中当σ被视为固定并被吸收进式(2)的学习率时高斯矩阵ES与NES是等价的。自然梯度的一个关键优势在于在更新搜索分布时它考虑了底层参数空间的局部几何结构从而使更新对参数化的选择具有不变性。3 相关工作3.1 进化算法进化算法长期以来一直是基于反向传播训练方法的一种引人注目的替代方案。尽管涵盖广泛的算法类别例如遗传算法Such et al., 2018或符号进化Koza, 1994当代关于进化的多数研究已转向更适用于大规模神经网络参数的算法Jaderberg et al., 2017; Hansen Ostermeier, 2001; Salimans et al., 2017。我们的工作聚焦于对预定义架构的权重进行进化其基础源于NESWierstra et al., 2011方法族。自Salimans等人2017将NES应用于传统强化学习环境中的策略学习以缓解策略梯度方法面临的挑战如长视野环境以来此类方法的影响力日益增长。此后进化算法被广泛应用于其他领域包括元学习如Lu et al., 2022; Metz et al., 2022; Lange et al., 2023; Goldie et al., 2024; 2025、超参数调优如Parker-Holder et al., 2021; Tani et al., 2021; Vincent Jidesh, 2023以及药物发现Towers et al., 2025。本文关注将进化策略应用于超大规模场景时的局限性与解决方案超越了前述工作所涉及的小型网络与种群规模重点聚焦于策略学习。特别地Salimans et al. (2017)使用的最大种群规模为1440而我们的最大种群规模可达数十万量级。进化策略受限于其对适应度函数进行完整可能代价高昂评估的需求这源于在长视野环境中模拟策略以及潜在的高内存占用。持久进化策略Persistent Evolution Strategies, Vicol et al., 2021通过在线更新网络即在展开过程中更新实现了显著加速后续工作进一步提供了方差缩减方法Li et al., 2023b; Vicol et al., 2023。我们指出这些工作与我们关注扩大进化策略种群规模的目标正交将这些技术与EGGROLL结合应用留待未来研究。3.2 大语言模型中的进化策略尽管梯度反向传播通常用于大语言模型的训练与微调先前研究已探索进化策略变体在微调中的应用。特别是零阶优化Zhang et al., 2024——其等价于种群规模为1的进化策略——被Malladi等人2023用于实现内存高效的大语言模型微调。Yu et al. (2025)通过将扰动投影至低秩子空间改进了零阶优化的收敛性。Jin et al. (2024)则直接在LoRA矩阵上执行进化策略。这些工作聚焦于监督微调场景在性能上可与完整微调相媲美但未确定零阶方法是否适用于预训练我们发现预训练性能需要大规模种群这表明零阶优化方法可能不适用于预训练。近期研究也探索了进化策略在大语言模型推理中的应用。Korotyshova et al. (2025)首先通过监督微调SFT训练LoRA适配器随后将其分解为固定的SVD基与通过CMA-ES训练的奇异值在数学推理基准测试上以显著更短的时钟时间达到与GRPOShao et al., 2024相当的性能。Qiu et al. (2025)则直接使用进化策略优化大语言模型的全部参数进行推理在倒计时推理任务上表现优于GRPO。然而这两种方法均采用相对较小的种群规模每次更新约百量级的独特扰动并通过为每个扰动收集数百条轨迹采样以高效利用GPU。相比之下我们的方法允许所有生成过程使用不同扰动使得每次更新的最大种群规模提升数个数量级等于最大推理批处理大小同时不牺牲token生成吞吐量。4 EGGROLL我们现在介绍并阐述我们的方法EGGROLL该方法在算法1中给出。在第4.1节中我们推导了一种低秩进化策略更新用以近似全秩进化策略梯度。使用低秩矩阵近似的一个实际问题是除退化情形外其分布与得分函数均无解析解因此在第4.2节中我们从极限高秩高斯分布出发推导出一个替代得分函数并将其作为近似方案提出。4.1 低秩进化策略4.2 得分函数逼近我们指出EGGROLL并不局限于任何特定的得分函数近似器我们在附录B中推导并探索了一组均场近似器作为替代方案。然而我们的实验表明高斯近似器在所评估的任务集合上具有最佳的整体性能。我们使用Nworkers个样本对式(5)中的期望进行蒙特卡洛估计并通过近似的随机梯度上升法优化参数μ从而得到高斯EGGROLL更新4.3 硬件高效的 EGGROLL 实现使用 EGGROLL 而非标准 ES 的一个关键原因是由于低秩扰动大规模种群可以在 GPU 上并行模拟。为了便于阐述我们从单个工作者 i 的角度撰写方程并在文本中解释这如何对应于批量 GPU 操作。5 逼近分析我们现在分析公式7中的高斯得分逼近以多快的速度收敛到公式4中的真实高斯 ES 矩阵梯度。我们对适应度函数引入以下形式正则性假设6 实验6.1 RNN语言模型的纯整数预训练为展示EGGROLL作为通用优化方法的潜力我们研究了EGGROLL是否可用于语言模型预训练。由于EGGROLL不依赖梯度我们可以专门设计语言模型架构以提高推理效率和硬件友好性。具体而言我们在以下约束条件下构建模型以强调EGGROLL的灵活性纯整数训练在H100系统上int8是最快速的数据类型其中int8矩阵乘法配合int32累加是最快的张量核心操作。此外整数数据类型在硬件中实现更为简单为高吞吐量系统提供巨大的能源节省Horowitz, 2014。因此我们在整个训练过程中将所有权重保持在int8格式所有激活值保持在整数格式绝不进行任何浮点转换。非线性RNN现代语言模型使用Transformer和SSM等序列并行架构因为它们能够在不通过时间反向传播的情况下实现稳定的梯度。然而大多数此类序列并行架构无法处理简单的状态跟踪Merrill et al., 2024而LSTM和GRU等经典循环网络只需单层即可处理这些问题。由于EGGROLL不需要通过时间反向传播我们可以使用更广泛复杂线性RNN在无界序列长度上进行训练Li et al., 2023a。具体而言我们开发了minGRU模型Heck Salem, 2017的一个变体该变体在整数格式下执行所有操作。移除所有激活函数受Foerster (2017)启发我们移除了所有激活函数如修正线性单元和双曲正切这是由于int8数据类型本身已存在非线性。具体而言int8值的饱和加法提供了足够的非线性这源于值隐式裁剪到int8动态范围而进化策略可以利用这一特性。我们将最终得到的语言模型称为EGGEvolved Generative GRU一种对EGGROLL友好的架构。其架构类似于标准的预层归一化transformer解码器模型但我们在以下方面进行了修改(1) 使用L1归一化的变体替代L2归一化以避免平方根计算(2) 用自定义GRU替换自注意力机制(3) 所有操作均在整数数据类型下执行。有关架构的更多细节请参见附录C。我们在minipile数据集Kaddour, 2023上训练一个具有6层和256隐藏维度的EGG模型进行字符级预测。每个种群成员在处理100个token后更新参数通过保留隐藏状态并在文档边界重置来应用截断ES。我们在图2b中绘制了不同种群规模下训练步骤的测试损失其中最佳测试损失为3.41 bits/byte。我们发现训练过程稳定损失曲线相对平滑尤其是在大规模种群情况下避免了基于反向传播训练在低精度数据类型下常见的损失尖峰、NaN值和其他不稳定性。值得注意的是我们最大的种群规模为比Salimans等人(2017)进行的最大实验规模大两个数量级而仅需单个GPU进行训练。我们观察到将种群规模乘以8会使损失在测试的种群值范围内降低约0.4尽管这种模式最终会因损失必须严格为正而中断。我们在附录E中进行了更多消融实验确定如何通过EGGROLL实现数据高效的训练并验证了大批量规模的重要性。6.2 强化学习任务在本组实验中我们将EGGROLL与Salimans等人2017实现的标准OpenES在强化学习任务上的性能进行对比。鉴于网络规模较小此尺度下可使用OpenES但我们指出随着网络规模增大标准OpenES的使用将变得不可行。我们采用标准设定即仅优化环境中的最终回报。对于EGGROLL与OpenES我们分别为每个环境单独进行超参数优化HPO。针对每种算法–环境组合我们基于先前工作与初步实验为所有关键超参数定义合理范围随后执行20次随机搜索试验每次试验对应一次采用随机采样超参数配置的独立训练运行。每种配置根据训练结束时均值策略参数所达到的最终回报进行评估。完成所有试验后我们选择产生最高最终回报的配置并基于该最优配置运行10次独立随机种子以评估性能报告这些种子的均值与均值标准误。我们使用包含3层、每层256个神经元的策略网络并在一系列展示不同能力的环境中进行评估。评估涵盖NavixPignatelli et al., 2024、CraftaxMatthews et al., 2024、BraxFreeman et al., 2021、KinetixMatthews et al., 2025与JumanjiBonnet et al., 2024环境套件共计16个环境。环境选择标准为根据原始论文该环境对PPO而言既非平凡可解亦非完全不可解同时在条件允许时我们选择属于不同类别的环境例如Kinetix中的环境尺寸或Jumanji中的类别。我们在图4中展示了部分评估环境的结果其余环境结果见附录G.1。研究发现EGGROLL在16个环境中与OpenES性能相当者占7个表现逊色者占2个表现更优者占7个。此比较尚未计入相较于OpenES全秩更新的速度提升。我们推测性能提升的原因在于大规模网络对OpenES而言难以优化而低秩更新对此类网络更为适用。所有超参数配置细节见附录G.1。6.3 大语言模型推理任务微调我们将EGGROLL应用于RWKV-7Peng et al., 2025模型在两类推理任务上的微调倒计时countdown与GSM8K。RWKV架构是一种循环模型相较于Transformer其特别适合并行化——原本用于KV缓存的内存可转而用于评估种群成员。图5a展示了倒计时任务中EGGROLL与GRPO的训练曲线。在相同硬件与实际运行时间下基于RWKV-7 1.5B模型的EGGROLL微调在倒计时任务上收敛至更高的验证准确率35%对比GRPO的23%。类似地图5b表明EGGROLL在GSM8K微调任务上亦优于GRPO。我们的得分函数与GRPO的组相对优势具有相似性。具体而言为对一组扰动方向E ≡ {E₁, …, Eₙ}进行评分我们首先计算其在|q| m个问题上的准确率{s₁,ᵠᵢ, …, sₙ,ᵠᵢ}形成得分矩阵。随后按问题计算z分数主要区别在于我们使用全局方差σ̄并对所有问题取平均以计算扰动方向Eᵢ的最终得分该得分函数的目的是使同一批次内所有问题在不同种群成员间获得同等权重。7 结论本文提出EGGROLL一种强大的黑盒优化方法通过低秩搜索矩阵将进化策略扩展至十亿参数规模及以上的模型。实验表明EGGROLL在秩低至r 1时仍保持有效性相较于全秩ES更新仅带来可忽略的性能下降却实现了显著的计算与内存节省。实证结果显示EGGROLL在白板式tabula rasa与多智能体强化学习任务中相比朴素ES带来大幅加速并可支撑大语言模型的端到端训练流程。我们的理论分析表明低秩EGGROLL更新随秩r快速收敛但当r 1时方法仍取得成功的原因尚需进一步理论阐释。展望未来我们正致力于将EGGROLL应用于现代基于梯度的技术难以触及的其他问题。特别是EGGROLL可赋能大规模端到端神经符号系统的训练Sarker et al., 2021此类系统包含不可微分组件。例如我们可以训练能与符号模块直接交互的神经网络以执行记忆或计算等专用功能亦可优化由语言模型构成的端到端系统使其在训练阶段即具备对推理时工具链及复杂系统中与其他智能体交互的认知能力。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻