
26年7月来自英伟达、斯坦福和德州奥斯丁分校的论文“RoboTTT: Context Scaling for Robot Policies”。现有的机器人基础模型通常使用单步或短历史的视觉运动上下文。本文提出一种名为“测试时训练机器人策略”RoboTTT的机器人模型和训练方法它将视觉运动上下文扩展到8K时间步比现有最佳策略高出三个数量级且不会增加推理延迟。在这种上下文长度下解锁机器人的全新能力从人类视频演示中一次性进行上下文模仿、实时改进策略、增强对扰动的鲁棒性以及在多阶段、长时域任务中表现更佳。此外随着预训练上下文长度的增加闭环性能也稳步提升。RoboTTT的核心是将测试时训练集成到视觉-语言-动作策略等机器人基础模型中从而生成一个序列模型。该模型的循环状态包含快速权重参数在训练和推理过程中均通过梯度下降法更新从而将历史信息压缩到权重空间并检索上下文信息以进行长上下文条件化。为了扩展训练上下文的长度该方法结合了序列动作强制和截断反向传播算法。在具有挑战性的真实机器人操作任务中RoboTTT 的整体性能比单步上下文基线模型提升 87%并且能够完整完成一项耗时五分钟、包含十个阶段的组装任务这是任何基线模型都无法做到的。使用 8000 个时间步长的上下文训练的 RoboTTT 模型比使用 1000 个时间步长预训练的同一模型性能提升了 62%这表明上下文长度可以作为机器人基础模型的一个新扩展维度。测试时训练机器人策略RoboTTT图 1是一种机器人模型和训练方案它将视觉运动上下文扩展到 8K 个时间步称为 RoboTTT-8K比最先进的机器人基础模型55175高出三个数量级且推理延迟并未增加。在这种上下文长度下RoboTTT 展现出新的机器人能力。通过长上下文条件化它能够从单个上下文人类视频演示中一次性模仿在 10 次试验中成功 6 次而基线方法则完全失败。它还展现出动态策略改进能力性能比未针对此能力进行训练的相同模型提高了 36%。在外部扰动下它的试验成功率为 83%而最佳短上下文基线模型的成功率仅为 53%。在多阶段、长时域任务中RoboTTT 的整体任务性能比单步上下文基线模型提升了 87%并且能够完全完成一项持续超过五分钟、跨越十个阶段的装配任务这是任何基线模型都无法做到的。此外扩展预训练上下文长度能够稳定地提升闭环性能RoboTTT-8K 的任务完成率比使用 1K 时间步上下文预训练的相同模型高出 63%并且比最佳短上下文基线模型高出 57%这表明上下文长度可以作为机器人基础模型的一个新的扩展维度。RoboTTT 的核心是将测试时训练 (TTT) (64; 78) 集成到视觉-语言-动作 (VLA) 策略 (51) 等机器人基础模型中。RoboTTT 是一种序列模型其循环状态由快速权重 (58) 组成与在推理阶段冻结的慢速权重不同快速权重在训练和推理过程中都通过梯度下降进行更新。该设计旨在解决长上下文视觉运动策略的三大挑战以足够的容量编码长历史记录、利用条件上下文12以及保持推理成本随上下文长度的变化。首先由快速权重参数化的快速模型例如多层感知器比循环神经网络的向量值状态具有更大的容量。其次在部署期间训练快速模型可以保留机器人观测和动作密集重复流中的显著特征并丢弃冗余特征。第三随时间传播快速权重可以保持推理成本恒定而即使使用键值缓存Transformer 的推理成本也会随着历史记录的增长而增加。至关重要的是通过在部署期间学习RoboTTT 实现了新形式的上下文内适应和策略改进。例如它利用演示新任务配置的人类视频进行条件化从而实现一次性模仿。通过 DAgger 蒸馏一种将 DAgger 式 (57) 错误纠正映射提炼为快速权重的训练过程该方法能够实时学习并改进自身性能。为了扩展训练上下文的长度该方法结合了序列动作强制和TBPTT从而允许上下文在不增加 GPU 内存的情况下增长。1. 模型架构RoboTTT 将 TTT 层集成到机器人基础模型例如 VLA 模型中同时保持与底层架构的兼容性因此适用于多种骨干网络。本文在 GR00T N1.7 (51) 之上实例化 RoboTTT。如图 2所示RoboTTT模型架构、训练和推理。TTT层位于DiT动作头的注意力层之后注意力层在每个时间步内运作而TTT层则跨时间步运作。训练采用序列流匹配损失函数并强制执行序列动作对每个动作块的噪声水平进行独立采样。推理从学习的初始值W0开始对每个观测值更新快速权重并将其向前传播。为了保留预训练模型的能力RoboTTT 从基础模型权重初始化并采用学习的 tanh 门控机制 (1)以在训练初期保持 TTT 的贡献较小。如图3所示使用 tanh 门控的计算流程TTT 的输出在添加到注意力输出之前会根据学习到的门控 tanh(α) 进行加权。2. RoboTTT序列训练在机器人轨迹序列上训练 RoboTTT以便在每个训练序列中快速更新权重从而学习合适的快速权重初始化及其更新动态。在长序列上使用完全反向传播BPTT进行训练时GPU内存会存储每个时间步的激活值因此GPU内存会随着序列长度的增加而增长。采用截断反向传播TBPTT方法将输入序列分割成若干段梯度仅在每段内流动图4所示。关键在于快速权重会跨越段边界传递因此TTT可以遍历整个序列而它们的梯度会在边界处分离。这样GPU内存由段长度而非序列总长度决定从而在固定内存预算下支持任意长的训练环境。需要注意的是快速权重初始化W0仍然会接收来自第一段的梯度该段的更新直接源自W0。如图 2 所示RoboTTT 从学习到的初始化 W0 开始每次展开更新当前观测值的快速权重并将其传播到下一个时间步。在每个时间步都会生成经过 k 步去噪的动作块。3. 从上下文中有效学习RoboTTT 将快速权重更新与慢速权重更新解耦通过屏蔽选定时间步的流匹配损失这些时间步充当纯粹的上下文在不提供模仿目标的情况下更新快速权重。这种灵活性使 RoboTTT 能够从异构上下文中学习例如人类视频演示或机器人自身次优的滚动轨迹。从上下文视频演示中进行模仿。将人类视频演示序列 video与执行相同任务的机器人轨迹 robot配对视频序列仅更新快速权重其流匹配损失被屏蔽而动作损失则在更新后的快速权重条件下基于机器人轨迹进行计算。通过对这样的配对进行训练模型能够学习从上下文视频中提取任务信息在测试阶段仅使用一个未见过的任务配置的人类视频进行训练即可实现单次模仿。DAgger蒸馏。考虑一个机器人部署过程其中收集如DAgger (57) 所示的人工纠正信息每当机器人犯错时人工操作员都会进行干预并采取纠正措施从而得到一个轨迹DAgger {(, _, _, _)}其中每个执行的动作块_t要么是机器人动作R_要么是人工纠正H_。这种交错部署展现一种自然的在线策略改进模式。标准的DAgger算法基于人工纠正进行微调并舍弃次优的机器人动作然而正是这些次优动作揭示每次纠正措施所针对的错误类型。 RoboTTT 则同时运用这两种方法但角色并不对称在序列训练期间快速权重会根据完整的交互历史进行更新不仅包括已执行的修正操作还包括次优的机器人动作本身而流程匹配损失则仅针对人类的修正操作进行掩蔽。将此过程称为 DAgger 蒸馏图 6所示。这种不对称性——将失败作为上下文将修正操作作为目标——正是人类从失败到修正的映射关系被提炼到快速权重中的方式模型学习如何根据失败情况生成修正操作而不是孤立地模仿修正操作从而更充分地利用了相同的数据。将其视为机器人领域中算法蒸馏 (39) 的一个实例由人类干预引起的改进过程被提炼到策略的快速权重调整中。在测试阶段模型无需人类干预即可在线执行此类修正操作其自身的修正操作随后会进入历史并被吸收到快速权重中正如人类在训练期间所做的修正操作一样。DAgger 蒸馏比标准 DAgger 训练具有更强的故障恢复能力和更高的任务性能。基线模型对于 GR00T N1.7 和 GR00T N1.7 Hist. 基线模型用官方实现 (51)并对其进行扩展以支持 GR00T N1.7 Hist. 的历史帧输入。对于 GDN 基线模型将每个 TTT 层替换为 Flash Linear Attention 库 (73) 中的 Gated DeltaNet 层并保持层位置、门控和参数数量与 RoboTTT 一致。评估将训练好的模型部署在 YAM 双手动桌面机器人上。为了确保不同方法的初始条件一致记录每个任务的初始物体位置并在评估时重现这些位置。由于单次人机视频设置下的评估时间较长分别评估 Pup Go Car 和 Circuit 任务的 20 次运行以及 Gear Bot 任务和 Circuit 任务的 10 次运行。