尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

POLARIS 背后的训练引擎 verl:HybridFlow 架构与 3D-HybridEngine 解析

POLARIS 背后的训练引擎 verl:HybridFlow 架构与 3D-HybridEngine 解析 POLARIS 背后的训练引擎 verlHybridFlow 架构与 3D-HybridEngine 解析【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARISPOLARIS 背后的训练引擎 verlHybridFlow 架构与 3D-HybridEngine 解析说到大模型推理能力的巅峰你可能会想到那些动辄数百亿参数的商业模型。但开源项目 POLARIS 用事实证明了另一条路仅基于 Qwen3-4B 这样的小模型通过强化学习RL后训练就能在 AIME25 数学基准上拿到 79.4 分反超 Claude-4-Opus、Grok-3-Beta 等顶级商业系统。而这一切的背后正是它的训练引擎verl——一个由字节跳动 Seed 团队发起、基于HybridFlow架构的大模型强化学习训练框架。本文将用通俗易懂的方式为你拆解 verl 的 HybridFlow 架构设计与 3D-HybridEngine 核心原理。什么是 verl为强化学习而生的大模型训练库verlVolcano Engine Reinforcement Learning for LLMs是 HybridFlow 论文的开源实现该论文已入选系统领域顶级会议 EuroSys 2025。它解决的是一个非常现实的问题大模型的 RL 训练远比普通预训练复杂得多——既要训练更新模型参数又要推理生成采样数据还要在两者之间反复切换。传统框架把训练和推理硬绑在一起切换成本高、资源浪费大。verl 则提出了两大杀手锏灵活用几行代码就能搭建 GRPO、PPO、DAPO、PRIME 等主流 RL 算法数据流高效无缝接入 FSDP、Megatron-LM 训练后端以及 vLLM、SGLang 推理引擎在 POLARIS 项目中verl 承担了全部 RL 训练任务相关配置都封装在scripts/train/qwen3-4b/stage1.sh这样的训练脚本中入口则是verl/trainer/main_ppo.py。HybridFlow 架构核心控制流与计算流的解耦要理解 HybridFlow先要理解 RL 训练本质上是两层数据流问题控制流决定高层算子如何执行比如先采样、再算优势、最后更新模型它表达了 RL 算法的核心逻辑计算流神经网络本身的运算如前向、反向传播、优化器更新在大模型时代计算流天然是多进程的模型太大必须拆分到多张 GPU。HybridFlow 的关键设计是控制流保持单进程运行计算流则交给多进程的 Worker 去执行。两者通过 Ray 调度解耦。这样做的好处立竿见影计算后端可替换——从 FSDP 切换到 Megatron控制流代码一行都不用改新算法实现简单——在单进程里写 PPO 主循环就像写普通 Python 程序一样直观资源摆放灵活——不同模型Actor、Critic、Reward可以自由映射到不同的 GPU 资源池WorkerGroup 与混合控制器RL 流水线如何运转在 verl 中每个 GPU 上运行一个 Worker多个 Worker 组成 WorkerGroup作为控制器与 GPU 之间的代理。以 PPO 为例verl 定义了三个 WorkerGroupActorRolloutRef管理 Actor策略模型、Rollout生成采样和 Reference参考策略三者共置是为了用 NCCL 快速同步权重Critic管理价值模型Reward管理奖励模型或奖励函数控制器通过装饰器注册的接口来调用 Worker比如generate_sequences、compute_log_prob、update_actor等数据的切分、分发、收集和拼接全部自动完成。这段逻辑的完整实现可以参考verl/workers/fsdp_workers.py和verl/workers/megatron_workers.py而训练主循环则在verl/trainer/ppo/ray_trainer.py中。3D-HybridEngine训练与推理切换的加速器RL 训练中最耗时的环节之一是模型在训练态和生成态之间反复切换训练时权重以 FSDP/Megatron 的分片格式分布生成时又要重组为 vLLM 能用的张量并行格式。如果每次都全量搬移权重通信开销惊人GPU 显存也会出现大量冗余。3D-HybridEngine正是为此而生它实现了两个目标消除内存冗余通过按需重建和复用权重副本避免在显存里同时维护多份模型显著降低通信开销训练与生成阶段切换时只传输必要的分片数据而非全量权重在实际运行中Actor 和 Rollout 共置于同一批 GPU 上由 ShardingManager如verl/workers/sharding_manager/fsdp_vllm.py以上下文管理器的方式完成权重重分片。这也是 POLARIS 能用 32 张 H800 在约 10 天内完成 4B 模型 RL 训练的关键原因之一每步仅约 0.33 小时。POLARIS 实战成绩小模型的逆袭POLARIS 用 verl 交出的答卷极具说服力。下图展示了各模型在 AIME25 上的表现POLARIS-4B-Preview红色柱以 79.4 分超越了众多超大模型注上图为项目评测结果图红色标注的是 Qwen3-4B65.6 分与训练后的 POLARIS-4B-Preview79.4 分提升幅度高达 13.8 分。如果对这套训练配方的技术细节感兴趣官方文档verl/docs/hybrid_flow.rst是深入理解 HybridFlow 编程模型的最佳入口。总结为什么 verl 值得关注verl 的价值在于它把RL 算法创新和底层工程实现彻底解耦算法研究者只需关注控制流逻辑工程能力则由 3D-HybridEngine、FSDP/Megatron 适配、vLLM/SGLang 集成等模块托底。POLARIS 的成功已经证明这条小模型 强化学习 高效引擎的路线完全可行。对于想复现或开展大模型 RL 研究的开发者来说verl 无疑是最值得上手的开源基础设施之一。【免费下载链接】POLARISScaling RL on advanced reasoning models项目地址: https://gitcode.com/gh_mirrors/polaris34/POLARIS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表