尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理

机器人不能停下来等模型:星尘发布 SmoothRL,让在线强化学习跟上大模型的异步推理 真实机器人没有“暂停键”。现在的 VLA、World-Action Model 往往一次生成未来一段时间的动作序列也就是 action chunk。模型越来越大推理时间也越来越长但机器人不能每隔几百毫秒就停下来等模型推理下一段时间的动作。尤其在投掷这类高动态任务里一次停顿就可能让已经积累起来的速度掉下去导致整个任务失败。所以真实部署里更常见的方式是异步推理机器人继续执行手头的动作模型同时在后台计算下一段。简单说手上做 A模型已经在算 B。但这给在线强化学习带来了一个新的问题模型一次生成了一段动作序列action chunk进入物理世界的真正会用的却往往只有其中一部分。模型“计划过”的动作和机器人“真正做过”的动作不再完全相同。近日星尘智能Astribot 基座模型团队发布能异步执行的在线强化学习框架 SmoothRLOnline Reinforcement Learning During Asynchronous Execution。解决的是大模型异步推理成为真实部署常态后与之适配的online RL 到底该从哪些动作里学。SmoothRL 首次将这类异步 online RL 放到真实高动态投掷任务中验证进一步证明在线学习不仅能用于高精度修正也能适配连续加速、精确释放、不能停顿的动态操作。图注SmoothRL 整体框架机器人在异步执行中持续产生真实数据基础策略提供通用能力在线 RL 会根据真实执行结果更新动作策略。异步执行之后RL 为什么会“对错账”传统在线 RL 往往默认一种更规整的节奏模型先算出动作机器人执行再根据结果更新策略。模型生成什么机器人就执行什么。异步执行打破了这个对应关系。等一段新的 action chunk 算出来机器人已经沿着上一轮指令往前做了一截而这一段新动作还没全部执行完下一轮推理结果又可能到来把后半段直接替换。于是一整段 action chunk 里有些动作已经来不及改有些真正执行了还有一些根本没有发生。如果强化学习仍然把整段动作一起拿来优化就会出现一个很直接的问题机器人来不及改或没做过的动作也可能因为这次任务成功而被“记功”或者因为失败而“背锅”。SmoothRL 先把这笔账拆清楚。它将 action chunk 按执行状态分成三个区域已提交区域committed region这些动作已经被上一轮推理“提交”了不能再改变确定会执行。执行区域execution region当前这轮新生成、机器人实际上会执行的动作。丢弃区域discarded region这些动作虽然模型生成过但机器人根本不会执行因为下一轮推理会把它们替换掉了。训练的时候不能把这三部分一视同仁。SmoothRL 的核心思想就是机器人真正执行了什么就只对什么进行强化学习。也就是说只让梯度穿过 execution region执行区域。这样训练出来的模型优化目标才和机器人真实运行时经历的过程一致。第二步是让训练和部署遵守同一套时间节奏。SmoothRL 在训练 rollout 中就直接运行异步推理模型计算和机器人执行并行发生replay buffer 记录的也是这种真实时间关系下产生的轨迹。团队将这一原则概括为Reinforce in Deployment在部署强化学习——不是先在一个理想的同步世界里训练再换成异步方式部署而是从训练开始就面对机器人真正会遇到的执行动态。在论文的具体实现中团队采用针对各任务微调后的 π0.5 作为基础策略并沿用 RLT 的基本骨架用轻量 TD3-style actor-critic 在原始动作空间预测 residual correction。S1 以 30 Hz 执行动作推理请求频率为 5 Hz即每 200 ms 得到一个新的 action chunk。基础策略每次预测 32 帧动作在固定延迟预算下Committed 与 Execution 共占 12 帧其中 6 帧属于本轮真正执行的 Execution Region其余 20 帧在执行前会被后续 chunk 覆盖。图注SmoothRL 将异步 action chunk 划分为 Committed / Execution / Discarded 三个区域并只让价值梯度通过真正执行的 Execution Region。从高速投掷到毫米级插入测试两类真实部署难题团队在绳驱本体星尘智能S1上测试了三项真机任务覆盖两类常见且互补场景高速动态操作与高精度双臂操作。特别是高动态任务机器人动作变化很快如果每一步都等模型算完再执行就会卡顿所以必须采用异步推理。动态投掷39% → 94%。机器人需要从随机位置抓取物体再投进不同位置的目标箱。这个任务不是到达一个目标位姿就结束而是要求手臂在摆动过程中持续积累速度并在准确时刻释放。论文特别指出一旦在 action chunk 边界发生停顿手臂可能几乎降到静止剩余摆动很难重新恢复所需释放速度。因此它对异步执行尤其敏感。在累计 250 个 rollout episodes 的评估节点成功率从基础策略的 39% 提升至 94%。给笔戴帽8% → 83%。双臂需要把笔和笔帽精确对齐允许的相对位姿误差约为 5 mm。基础策略通常已经能到达目标附近但对不同笔帽位置的微小变化适应不足。最终成功率从 8% 提升至 83%。快递开箱30% → 90%。机器人需要用约 1 mm 宽的刀片插入仅 2—3 mm 宽的箱盖接缝再沿接缝切开胶带。基础策略存在稳定左偏。值得注意的是它的学习曲线并非一路上升150 个 rollout episodes 时成功率一度从 30% 降到 20%随后回升至 40%最终达到 90%。真实在线探索并不一定单调变好。图注三项真机任务随累计 rollout episodes 增加的成功率变化。比成功率更值得看的是机器人的“错法”变了。RL 之前三项任务都有明显的系统性偏差投掷时不能根据目标距离正确调节释放速度开箱时刀片持续向左偏给笔戴帽时对不同笔帽位置产生过于相似的动作。在线 RL 做的就是利用真实执行结果一点点把这些固定偏差修回来。到最终 checkpoint失败已经明显向成功位置收缩。开箱任务的失败样本中刀片相对接缝的左右偏差约为 1—2 mm给笔戴帽的失败样本也主要变成了正确位置附近的小幅错位。所以这里的 RL并不是从零重新教机器人“什么叫开箱”而是在做一件更接近部署的问题把一个已经基本会做的策略继续练到足够准确。而且更准的同时还要兼顾动作平滑性。通过在策略中加入平滑性约束在一次真实自主投掷 rollout 中经过在线 RL 后右侧末端执行器的加速度均方根下降了 52%急动度Jerk下降了 47%。也就是说机器人不仅成功率更高突然加速、减速和方向变化也更少整个投掷过程更平稳、更连续。图注动态投掷中的 Velocity / Acceleration / Jerk 对比机器人开始工作以后训练还没有结束过去几年机器人基础模型主要解决的是“会不会”用更多数据、更强模型把能力做宽。但机器人真正进入真实环境以后新的问题往往不是完全不会而是差几毫米、差半拍或者换一个物体位置就不够稳定。SmoothRL 关注的是这之后的一层一个已经具备基础能力的 pretrained policy进入真实世界以后能不能继续根据真实执行结果修正自己。论文当前使用的是稀疏的任务成功 / 失败奖励训练过程中操作员也可以在必要时介入介入动作属于 raw action space 中并可直接用于后续的模型训练。因此这还不是完全无人参与的“自主进化”而是一套面向真实部署的更高效的在线后训练机制。它也有明确边界。当前实现要求每次 chunk-level inference 都在预设 latency budget 内完成轻量 residual policy 的表达能力也受到冻结基础策略限制。如果基础策略本身离目标行为太远局部 residual correction 并不能凭空把它救回来。下一步团队计划进一步探索更大范围的策略更新、更广泛的任务分布以及异步执行与生成式策略端到端优化之间的结合。SmoothRL 指向的是一个正在变得越来越具体的问题预训练让机器人学会怎么做真实世界里的后训练再把这些能力练得更准、更稳、更可靠。SmoothRL 背后延续了星尘在机器人模型上一条独特的长期判断动作不是视觉或语言模型最后附带生成的结果而应该成为机器人智能里的“第一公民模态”。 因为机器人最终不只是为了看懂世界更要在物理世界正确行动。所以Lumo系列基座模型始终关注“为什么要这样动”从Lumo-1的显式推理、到Lumo-2预测世界因动作带来的变化都在沿此思路发展。在这条主线下星尘也形成了从前端 Agent、中间基座模型、到 RL 后训练的完整模型布局Agent 负责交互、记忆、理解任务与调用能力基座模型逐步形成开放场景里可泛化的通用操作能力RL再从真实执行中的成功、失败和反馈中修正策略、持续进化。在模型全面发展时星尘**“AI模型-具身OS-绳驱本体”** 的全栈系统也在持续迭代推动Physical AI的应用与规模化部署。SmoothRL 由星尘智能王佳楠担任项目负责人高广、农宇轩为共同第一贡献者黄百富参与研究。
返回列表