尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何在本地跑通 AReaL:LLM Agent 异步强化学习训练完整指南

如何在本地跑通 AReaL:LLM Agent 异步强化学习训练完整指南 如何在本地跑通 AReaLLLM Agent 异步强化学习训练完整指南【免费下载链接】AReaLThe RL Bridge for LLM-based Agent Applications. Made Simple Flexible.项目地址: https://gitcode.com/GitHub_Trending/are/AReaL把你 Agent 应用里的模型 API 地址换成 AReaL 提供的训练端点后模型就开始从 Agent 的真实请求里学习。AReaL 是由清华 IIIS 与蚂蚁 AReaL 团队开发的强化学习系统定位是 LLM Agent 应用与 RL 训练之间的桥。它到底能干什么异步 RL 训练能力一览AReaL 是一套以异步为核心的 RL 训练基础设施推理端SGLang 或 vLLM和训练端FSDP 或 Megatron解耦后并行工作轨迹生成不必等批次内最长的样本跑完训练更新也不再把推理卡挂起等梯度。GRPO、PPO、DAPO、GSPO、LitePPO、M2PO、KPop、DPO 等 15 种以上算法内置可用模型侧覆盖 Qwen2/3、Qwen3-MoE、Qwen-VL、Gemma 3 等主流家族而要把一个黑盒 Agent 应用接进来训练只需要把它的 base_url 换成 AReaL 端点不用改写 rollout 逻辑。维度AReaL典型同步 RL 框架生成-训练调度异步并行无批次等待分批串行生成阻塞训练黑盒 Agent 接入改一行 base_url需要定制 rollout 流程算法覆盖GRPO/PPO/M2PO/KPop 等 15通常仅 1–3 种规模1.5B 到数百亿 MoE以单机小模型为主 所有算法都支持异步/同步两种模式由max_head_offpolicyness控制设为 0 即退回同步版本方便做消融对照。官方技术博客给出的数据是同一集群上全异步模式相比同步基线有 2.77 倍加速且模型效果没有下降。从 0 到跑通单节点最小配置硬件一句话官方测试配置为单节点 8x H800、CUDA 12.x、Ubuntu 22.04 或 CentOS 7单节点跑 1.5B 的 GSM8K 示例一台 8 卡机即可官方 Docker 镜像areal-runtime已内置全部运行时依赖。第一步克隆仓库并安装环境git clone https://gitcode.com/GitHub_Trending/are/AReaL cd AReaL pip install uv uv sync --extra cuda第二步直接跑官方 GSM8K 示例。脚本会自动下载 openai/gsm8k 数据集与 Qwen2.5-1.5B-Instruct 模型python3 examples/math/gsm8k_rl.py --config examples/math/gsm8k_grpo.yaml scheduler.typelocal几个关键参数都可用命令行覆盖不必改 YAMLscheduler.typelocal单机跑多机改成ray或slurmrollout.backend/actor.backend推理与训练后端及并行度形如sglang:d4p1t1experiment_name/trial_name实验名决定 checkpoint 与日志落盘路径更完整的安装步骤与参数说明见官方 Quickstart。真实场景实测从数学推理到分布式 Agent数学推理GSM8K。输入Qwen2.5-1.5B-Instruct、单机 8 卡、GRPO 每题 4 条 rollout。输出奖励曲线随训练步数稳定上升官方用这条管线训出的 8B/14B 模型AReaL-boba²在 LiveCodeBench v5 等编码基准上拿到 SOTA 级分数14B 为 69.1。自定义任务Countdown 数字游戏。输入一个自定义 reward 函数examples/countdown/reward_score.py 里几十行训练代码零改动。输出下图中奖励随训练步数稳步爬升模型学会了如何把给定数字凑到目标值。分布式 Agent 训练。CAMEL-AI 团队就是用 AReaL 端到端训练了终端 Agent SETA——他们的做法就是把 Agent 运行时指向 AReaL 的 RL 服务训练代码放在自己的仓库里复用。多机调度用 Ray 或 Slurm 启动python3 examples/math/gsm8k_rl.py --config examples/math/gsm8k_grpo.yaml scheduler.typeray \ cluster.n_nodes4 cluster.n_gpus_per_node4 \ rollout.backendsglang:d12p1t1 actor.backendfsdp:d4p1t1适合谁、什么时候用RL 算法研究者想对照 GRPO/PPO/DAPO 快速消融一个新算法时15 种以上内置算法加上可调的异步程度让你几乎不用写系统代码。Agent 应用工程师这是它最有价值的场景——现有 OpenAI Agents、CAMEL-AI、OpenClaw 等框架的应用改一行 base_url 就能接入真实使用轨迹直接变成训练数据。大模型团队训练工程师FSDP 与 Megatron 双训练后端、MoE 专家并行、vLLM/SGLang 双推理后端官方已在 235B MoE 上验证过规模化训练。国产硬件用户社区贡献的 Ascend NPU 分支已稳定支持VLM 的 NPU 训练也有完整示例可直接参考。进阶玩法参数怎么调、多机怎么扩两个实用技巧。参数调优上gconfig.max_new_tokens控制生成长度上限gconfig.n_samples控制每题采样条数越大越稳但越慢max_head_offpolicyness控制生成模型比训练模型最旧可差几个 step——这是异步模式下新鲜度换吞吐最直接的旋钮调参时优先动它。模型定制上如果你的架构不在支持矩阵里可以基于 PyTorch Archon 后端扩展新模型细节见 Archon 参考文档面向特定任务基于官方开源的 boba² checkpoint 继续微调也是可行的路径。社区与许可AReaL 采用 Apache 2.0 许可证开源。项目由双周社区会议驱动会议材料已迁移至独立的 community 仓库见 assets/community/README.md按 CONTRIBUTING.md 的规范从提 issue 到实现新算法都欢迎参与贡献。写在最后AReaL 的价值在于把用 Agent和训 RL合成了同一条流水线推理卡一直生成训练卡一直更新模型在真实场景里持续变强。建议先拿单节点的 GSM8K 1.5B 示例把奖励曲线跑出来看一眼确认环境没问题后再把自己的 Agent 任务接上去。【免费下载链接】AReaLThe RL Bridge for LLM-based Agent Applications. Made Simple Flexible.项目地址: https://gitcode.com/GitHub_Trending/are/AReaL创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表