
Hydra-0通用世界模型发布降低误差提升性能与迁移能力机器之心编辑部消息来自英伟达、哈佛大学等的联合研究团队提出了Hydra-0一种以动作流Action Flow为条件的通用世界模型。世界模型的挑战与Hydra-0的提出如果说大模型正在让机器「理解语言」那么世界模型World Model试图解决的则是让机器真正理解一个更复杂的问题做出一个动作之后现实世界会发生什么这个问题远比「看懂一张图片」复杂机器人不仅需要识别桌面上的杯子、衣服、箱子等物体还需要理解自身运动与环境变化之间的因果关系。例如当机械臂向前移动时夹爪会出现在什么位置当夹爪抓住一块布料并向右拉动时布料会如何变形当机器人执行一段动作序列时几秒之后整个场景又会变成什么样。一个基于多样化交互数据训练的基础世界模型可以通过捕捉不同机器人和交互场景之间共享的物理规律成为适用于多种机器人及交互环境的通用预测模拟器。然而尽管目前已经拥有大量丰富的交互数据业界仍然缺乏能够跨越不同机器人本体、任务和环境进行泛化的可迁移基础世界模型transferable foundation world models。为此联合研究团队提出了Hydra-0。该模型将机器人的动作表示为像素运动pixel motion这种统一的视觉接口使通用世界建模与控制成为可能模型能够跨越不同的机器人本体、任务、环境以及视频生成骨干网络学习机器人动作所产生的后果。在最佳配置下与以动作作为条件的基线模型相比Hydra-0将机器人运动误差降低了90.4%将物体运动误差降低了60.2%同时支持零样本组合以及数据高效的适应。在RoboLab基准测试中Hydra-0对重放实验与参考实验的成功率进行了预测两者之间的Pearson相关系数达到r 0.96。研究亮点与语料库构建研究亮点将机器人动作条件建模为具有运动学约束的图像平面动作证明动作流可以成为跨机器人本体和视频生成骨干网络的通用世界建模接口将同一接口反向用于世界动作模型实现从任务意图到机器人动作的推断多机器人本体训练语料库构建为了构建这样的通用世界模型研究人员从7个数据源汇集了一个涵盖机器人与人类交互的多机器人本体训练语料库multi-embodiment training corpus。各数据源情况如下DROID提供了大规模、场景多样的单臂Franka机器人操作数据是本研究的主要机器人数据来源ABC-130k和MolmoAct2提供了双臂遥操作数据EgoDex提供了使用Apple Vision Pro采集的第一视角人手操作数据Deform360提供了使用UMI夹爪进行可变形物体操作的手持式夹爪示范数据XVLA-Soft-Fold和H1-Fold-Clothes分别贡献了规模较小的双臂以及人形机器人折叠衣物数据集Interactive World SimulatorIWS任务仅用于数据效率评估并不纳入训练语料库由于本文重点关注可变形物体交互因此主要保留与可变形物体相关的数据包括布料、电缆、绳索、袋子和纸张等。研究人员将主要数据源统一转换为共享的、以单个episode和单个摄像机视角为单位的数据布局视频帧被重新采样至480p、16 fps并切分为互不重叠的81帧窗口。每个窗口包含密集点轨迹dense point tracks、语言描述language caption、预先计算的VAE潜在表示VAE latents以及在数据源允许的情况下提供的本体与物体标注。除上述针对任务层面的可变形物体数据筛选外研究人员还针对不同数据源组合使用了三种窗口级筛选条件其阈值根据运动评分直方图进行调整。第一种是静态窗口筛选static-window filter如果一个窗口中可见轨迹的路径长度第90百分位数在480p分辨率下低于50像素则删除该窗口。第二种是夹爪冻结筛选frozen-gripper filter如果机器人本体轨迹的运动幅度低于同样的50像素阈值则删除该窗口。第三种是无内容语言描述筛选contentless-caption filter如果DROID数据集中的episode语言标注没有描述任何可执行的操作内容则删除该episode。Hydra-0框架正向与逆向模式Hydra-0的模型框架可以理解为两个相互对应的方向正向模式和逆向模式。正向模式解决的是世界模型最基本的问题如果机器人这样运动接下来世界会发生什么在逆向模式下模型可以反过来回答另一个问题如果希望物体按照某种方式运动那么机器人应该怎么动研究人员考虑一个部分可观测的环境在该环境中机器人在时间(t)接收一个RGB观测并执行一个动作编码器将初始观测映射为空间潜在状态使用动作流action flow表示动作序列并令动力学模型根据初始潜在状态和动作流预测未来的潜在状态序列随后解码器生成与之对应的RGB视频序列。动作流的构建与采样研究人员并不直接让模型以依赖特定机器人本体的控制指令作为条件而是首先将控制指令映射为动作流。动作流由一组位于相机平面上的轨迹构成用于描述机器人本体可见部分按照给定指令产生的运动。在每一个训练步骤中从经过语义约束的轨迹集合中采样以下四种条件策略之一Embodiment选择作用主体上的轨迹是主要采用的动作条件策略它包括可见的机器人连杆、夹爪以及人手等轨迹Object选择训练过程中被操作物体的未来运动轨迹。当在推理阶段显式提供物体轨迹时同一种模式还可以进一步提供目标运动条件使世界模型根据目标物体运动推断与之匹配的机器人运动All从所有已经完成语义约束和未完成语义分配的轨迹中进行采样当数据中的语义标注不完整时这种策略仍能够让训练过程保留大致的运动对应关系None移除轨迹条件相当于进行条件随机丢弃使模型仅依赖文本和图像条件进行预测基于动作流条件的视频预测在长度为(H)的预测时间范围内运动学约束视频预测器以动作流作为条件生成未来的观测结果。高效因果式滚动生成为了满足机器人实际部署对效率的要求研究人员将因果式生成的自回归转换autoregressive conversion与改进的分布匹配蒸馏Distribution Matching Distillation相结合从而实现长时间范围的因果生成以及少步采样。开放环策略评估与逆向控制正向模式 - 策略评估在正向模式下模型接收根据机器人控制指令或机器人实际完成的运动轨迹计算得到的夹爪运动流并预测由此产生的视频结果逆向模式 - 世界动作模型针对逆向模式构建了一个世界动作模型该模型以目标物体运动流作为条件同时不提供夹爪运动流实验结果与性能评估可执行动作流条件的有效性研究人员通过训练采用相同动作流构建方式、数据集组合和预测时间范围的可执行动作流条件Cosmos 2.5和Wan2.2模型检验可执行动作流能否在不同视频生成架构之间实现迁移。在大多数指标单元格中研究提出的方法均取得了最佳的点估计结果。在采用相同Cosmos 2.5骨干网络的情况下将Cosmos 2.5原生的相对6D动作表示替换为提出的可执行动作流后OursCosmos 2.5 2B在全部五个数据集上的PSNR、SSIM、夹爪流EPE、FID和FVD以及报告物体EPE的四个数据集上的物体流EPE均取得了更优的点估计结果。多机器人本体中期训练带来的数据效率提升在动作流能够支持高效的多机器人本体中期训练multi-embodiment mid-training的基础上研究人员希望验证的问题是多机器人本体中期训练能否减少后续后训练阶段所需的任务特定机器人数据量。研究的多机器人本体中期训练在尚未接触任何任务特定数据之前就能够实现最强的迁移性能。在IWS任务上的数据效率方面在0%数据条件下在全部六项任务中Ours (MT)的LPIPS、物体流EPE和FVD点估计结果均优于Ours (PT)这一结果与多机器人本体中期训练所带来的知识迁移相一致。这种优势在经过任务适应后依然存在在100%数据条件下Ours (MT)在全部六项任务上均取得最低的LPIPS和FVD并在其中四项任务上取得最低的流EPE在Bimanual box任务上Ours (MT)与Ours (PT)的差距仅为0.014像素在Bimanual rope任务上与IWS的差距仅为0.15像素。从视觉外观、运动以及时间一致性这三个互补维度的指标来看模型较早出现的性能平台期表明多机器人本体中期训练有望显著降低动作流后训练所需的目标任务数据量。推理速度机器人实际部署对生成延迟和吞吐量提出了要求因此研究人员也对模型的生成速度进行测量以评估其滚动生成过程是否能够满足机器人交互的时间预算。与完整序列的双向采样相比采用KV Cache的因果式自回归转换cached causal autoregressive conversion速度提高了1.68倍。尽管网络评估次数从50次增加到了153次但每次评估仅处理一个包含7个潜在帧的时间块并且每个时间块只需要进行一次重新缓存因此整体速度反而更快。进一步采用蒸馏后网络评估次数减少至15次速度在此基础上进一步提升约9.5倍最终达到62.0帧/秒相对于原始方法实现了16.0倍的纯生成速度提升。开放环策略评估RoboLab策略在生成环境中的成功率与参考成功率高度一致Pearson相关系数r 0.96Spearman相关系数ρ 0.93平均绝对误差为5.7个百分点。在跨任务进行平均后生成结果的成功率同样能够复现5个策略在参考环境中的排名。真实世界概念验证研究人员还在真实世界机器人环境中对成功和失败的折叠衣物轨迹进行了重放。生成的运行过程在定性上保留了原始任务中不同的结果初步表明这种策略评估方法有望进一步拓展到RoboLab基准测试之外的真实机器人环境。结语与展望总体而言Hydra-0提出的运动学约束动作流为跨机器人本体、跨视频生成骨干网络的神经世界模拟提供了一种统一的视觉控制接口。实验表明该方法不仅能够提升动作条件视频预测和数据高效迁移能力还可用于开放环策略评估在RoboLab中生成结果与真实重放结果的成功率达到Pearson r 0.96。进一步通过世界动作模型Hydra-0能够从人类示范中的目标物体运动流反推出匹配的机器人运动并转化为可执行动作。不过目前模型仍存在厘米级抓取误差对深度及接触状态的理解也存在局限腕部摄像机和移动操作等场景尚缺乏系统验证。未来随着深度、触觉、力觉等多模态信息以及闭环评估的引入动作流能否真正成为连接任务意图、世界预测与机器人执行的通用接口值得持续关注。