尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Zero-WAM——基于人类视频的上下文世界-动作建模:面对未见任务,给一段人类示范视频作为prompt,不微调直接输出对应的机器人未来视频和可执行动作

Zero-WAM——基于人类视频的上下文世界-动作建模:面对未见任务,给一段人类示范视频作为prompt,不微调直接输出对应的机器人未来视频和可执行动作 前言在机器人学习中零样本跨任务泛化——即策略必须完成训练阶段从未见过的操作任务——依然是核心挑战对于大语言模型来说只需在上下文中描述一个新任务模型便能在不更新参数的情况下完成该任务这种“上下文学习”in-context learning, ICL形式将泛化问题转化为任务描述问题详见本博客中的解读《ChatGPT技术原理解析从RL之PPO算法、RLHF到GPT4、instructGPT》为实现跨任务泛化作者将这一范式引入机器人操作领域并指出对操作任务而言最自然的任务描述是人类视频与语言不同人类视频能够提供关于目标任务演化过程的丰富视觉线索由此蚂蚁灵波与港科大联合提出 Zero-WAM这是一种因果视频-动作模型可以通过在上下文中跟随人类视频引导来执行未见过的任务为解决任务丰富的人机配对数据稀缺问题作者提出了一条自动化数据构建流水线将按任务采样的机器人轨迹转换为语义匹配的人类视频从而构建出 HumanGen 数据集其中包含 8.6K 个任务、共74.2K 对人机 ICL 样本针对模型训练作者进一步提出“上下文未来片段预测”in-context futurechunk prediction, IFP目标用以抑制策略从已见任务中学习到的捷径并迫使策略从视频提示中抽取任务信息本文进一步见证大模型对具身智能的直接提升预示着具身智能进一步朝GPT3时刻迈进不管之前有多少家公司吹嘘自己的工作或某工作被某媒体吹嘘达到了GPT3或ChatGPT时刻那都是扯淡当然了Zero-WAM也只是朝GPT3时刻迈进其也无法宣称达到了GPT3时刻且也进一步证明如果你学好了大模型再干具身智能便已经具备了至少一半的必备基础/能力顺带说一句其实蚂蚁灵波之前推出的LingBot系列模型一直都有关注印象比较深刻的两点是1 数据规模大、2 泛化到各种本体上此外并无太多其他更深刻的印象而本次他们和港科大联合推出的Zero-WAM使得蚂蚁灵波成为具身大脑领域中影响力更大的一方了且和通义千问一样愿意持续开源Repect太长不看版为了方便大家 最快速度的理解Zero-WAM我用大白话 给大家解释一下因为Zero-WAM 想针对一个未见的新任务通过先人类做一遍示范然后机器人便可以照着这个人类示范直接做出来而要练就这个能力则需要模型学会根据人类操作视频 匹配对应的机器人操作视频 故需要人类和机器做各种同一任务的对比数据集那同一个任务下是根据人类操作视频生成对应的机器人操作视频呢还是反过来根据机器人操作视频生成人类操作视频————事实是根据机器人操作视频依托视频生成模型生成人类操作视频之后有了大量的人-机匹配操作数据集之后便可以在训练的时候 让模型Zero-WAM 根据人类操作视频去生成对应的机器人操作视频而机器人操作视频 本身大量存在且是真实的、真的值故可以做ground truth第一部分 Zero-WAM: In-Context World-Action Modelingfrom Human Videos for Open-Ended Task Generalization1.1 引言与相关工作1.1.1 引言如原论文所述零样本跨任务泛化对于通用机器人操作至关重要机器人应当仅依赖部署时可用的信息就能推断在一个从未练习过的任务中应如何行动受上下文学习in-context learning, ICL[1,2] 的启发——在该范式中模型无需更新参数仅根据输入上下文即可解决新的问题作者将机器人任务泛化视为通过部署阶段提供的上下文来指定一个未见过的任务。这一视角为开放式的任务泛化提供了一条路径策略可以从上下文中推断出期望的任务并将其转化为可执行的机器人行为近期的视觉-语言-动作VLA模型 [3,4,5,6,7,8,9,10] 和视频-动作模型 [11,12,13,14,15,16] 已经显著拓展了机器人策略的能力但二者在很大程度上都依赖语言作为任务接口然而语言往往对操作任务描述不足空间约束、中间状态以及时间结构都难以用语言完整表达即使是十分详细的文字说明也无法直接提供场景应如何随时间演化的视觉证据人类示范视频则为预期任务提供了一种自然的“上下文内”规格说明 [17,18]。通过直接呈现期望的视觉状态变化及其时间演化过程这类视频为场景应如何变化提供了具体的视觉证据尽管人类视频本身并不能直接转化为可执行的机器人动作但它为策略提供了一个视觉参照使其能够从中推断出期望的任务演化过程并通过机器人自身的形体与动力学特性将其实现然而要大规模利用人类示范视频面临两个关键挑战首先大规模且任务多样的人类—机器人配对数据仍然稀缺并且人工收集成本高昂 [19,20,21]从人类视频指令中学习需要与之在语义上对应、同时保留可执行动作的机器人轨迹但此类配对数据在大规模条件下几乎不可获得其次在已见任务上训练得到的策略可能会学到“捷径”从而忽略上下文中的人类视频具体来说往往仅凭机器人自身的历史信息和文本指令就可以预测下一段机器人的视频—动作片段。因此模型在熟悉的训练任务上可能表现良好却并未真正学会利用人类视频而在测试阶段当需要通过视频来明确一个未见过的任务时模型反而会对视频利用不足为了解决这些挑战来自1Robbyant(即蚂蚁灵波), 2HKUST (GZ), 3HKUST的研究者提出了 Zero-WAM这是一种因果视频动作模型能够在上下文中遵循人类视频指令实现机器人任务的零样本泛化其paper地址为Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization其项目地址为robbyant-research.github.io/Zero-WAM其GitHub地址为github.com/robbyant-research/Zero-WAM具体而言Zero-WAM 在单一策略中支持两种任务指定形式自然语言指令和人类演示视频。在任一形式的指令给定后模型会自回归地预测未来的机器人视频以及可执行动作。人类视频使 Zero-WAM 能够将这些预测建立在示范所体现的视觉状态变化之上从而提供关于预期任务演化的额外信息而这些信息仅从语言和机器人历史本身是无法获得的此外作者做了两个创新第一个是数据层面的创新即造出配对数据为了解决基于人类视频指令的训练扩展问题更是提出了一种“上下文内(in-context)人类视频生成”流程该流程利用按任务采样的机器人轨迹来构造在语义上匹配的人类操作视频每个生成的人类视频都会与其对应的机器人轨迹配对机器人轨迹保留可执行的机器人动作从而形成一个人类-机器人上下文内学习ICL对由此得到的HumanGen数据集包含7.42 万个人类-机器人 ICL 对覆盖 8,600 个任务且作者进一步通过将公开的机器人轨迹重新划分为6,000 多个操作任务并在任务层面进行轨迹采样对机器人预训练数据进行任务均衡的筛选与整理该过程在每个训练 epoch 中大约产生 40 万条机器人轨迹作者将其称为Task-diverse VA此番任务均衡采样目的是一方面为上下文内人类视频生成流程提供任务丰富的源机器人轨迹另一方面也防止视频-动作预训练被少数任务中大量重复的遥操作轨迹所主导HumanGen与 Task-diverse VA 相结合为因果视频-动作预训练提供了可扩展的人类视频任务规范以及多样化的机器人视频-动作动力学下图图 2 总结了最终的数据构成以及上下文内人类视频生成流程(还没太看明白没事下文还会进一步详述)第二个是训练层面的创新——解决模型走捷径的问题即说白了标准下一片段预测只靠局部机器人历史就能蒙对(尤其训练里见过的任务)模型完全可以无视上下文里的人类视频照样训练得很好——但测试时遇到新任务就不会用视频了故为确保 Zero-WAM 使用上下文中的真人视频信息而不是依赖机器人历史和文本中的捷径作者还提出了一种“上下文未来片段预测”In-context Future Chunk PredictionIFP目标相比之下IFP 从当前的机器人视频表征中监督预测多个跨步采样的未来机器人视频片段从而促使模型编码由真人视频所传达的更长期任务演化过程从而让训练目标强制模型从视频里取信息而不是抄机器人历史的近路总之总结如下1.1.2 相关工作1.1.3 数据创新包含上下文内的人体视频生成流程、上下文内 HumanGen 数据集零样本机器人任务泛化不仅需要一种能够迁移到未见任务上的指令接口还需要在训练数据层面覆盖多样的任务动力学而不是单纯增加机器人轨迹的数量作为工程基础作者首先通过在任务层面对公开的机器人预训练数据进行重新采样整理出任务多样化的 VA 数据Task-diverse VA data在相同的任务级采样基础上提出了“上下文内人类视频生成流程in-context human video generation pipeline”用于将按任务采样得到的机器人视频转换成人类视频指令生成的人类-机器人 ICLin-contextlearning配对构成了 HumanGen其中包括预训练 ICL外部、预训练 ICL内部、仿真 ICL以及真实世界 ICL图 2 总结了这一数据构成以及用于生成 HumanGen 数据的整套流程接下来逐一具体的阐述以上三点首先重新采样任务多样化的 VA 数据VAdata来自公开的机器人视频-动作Video-Action, VA预训练数据集包括 AgiBot [23]、InternData-A1 [24]、Open-X-Embodiment [4]、RoboCOIN [25] 和RoboMIND [26]。这些源数据集与 LingBot-VA [11] 所使用的公开 VA 预训练数据集相同尽管这些数据集包含大量机器人轨迹并覆盖广泛的任务类型但其中许多轨迹来自对同一任务的反复远程操作。如果直接使用这种原始分布进行预训练模型将过度受冗余轨迹影响从而无法充分受益于源数据集中本就存在的任务多样性为了解决这一问题作者对每个数据集重新按任务进行划分其中每个任务由“操作动作与对象”的组合唯一确定当原始数据集中提供任务标签时作者直接使用其元数据获取任务标签若元数据不足则从机器人轨迹中解析得到任务标签随后从每个任务中采样一个有上限的轨迹数量并根据各源数据集任务内部多样性intra-task diversity的不同对这一采样上限进行调整在五个源数据集中每个训练 epoch作者共采样到 6,000 多个任务以及约 40 万条对应的机器人轨迹。这个经过均衡的视频-动作语料库能够有效地将一个通用领域的视频生成模型适配为自回归式的机器人视频-动作模型其次对于上下文内的人体视频生成流程人体视频示范通过可视状态变化直接传达任务语义相比机器人示范更容易获取并且不依赖测试时所使用的具体机器人形态。因此扩展富含任务信息的人机“上下文学习”配对数据是实现跨任务泛化的一条有效途径然人工手动收集这类成对的人类与机器人动作数据十分困难且当任务种类需要高度多样化时成本会变得尤为高昂因此作者从机器人预训练语料库出发并且再次在任务层面上对示例轨迹进行采样按照『上文重新采样』的方法执行这样就获得了一大批带有可执行动作标注的机器人视频随后引入了一条基于上下文的人类视频生成流程将这些机器人轨迹转换为具有相同任务语义的人类操作视频为了增加人机 ICLin-context learning上下文学习配对中视觉对齐的多样性生成的人类视频在背景、视角、环境风格、物体实例以及物体摆放位置等方面均有所变化同时保持相同的任务语义图 2 底部部分展示了用于生成人体视频指令的、基于上下文的人体视频生成流程对于每一段采样得到的机器人视频作者首先使用一个 VLMGemini 3.1 Pro [27] 或 Qwen3.6-Plus [28]进行任务分析VLM 会抽取任务级信息包括任务名称、初始物体状态、物体状态变化以及最终物体状态同时它还会生成一个图像编辑prompt将机器人视频的第一帧转换为对应的人类操作场景中的初始观测图像通过该图像编辑提示注入前文描述的视觉对齐变化同时保持任务语义不变在给定机器人第一帧和图像编辑prompt的情况下图像编辑模型Nano Banana 2 [29] 或 Qwen-Image-2.0 [30]会为对应任务生成初始的人类观测图像随后将这一编辑后的人类观测图像与前面提取的物体状态信息一并输入 VLM由其生成视频生成提示描述人手应如何操纵这些物体以完成该任务该提示会被发送给视频生成模型Wan 2.7 [31] 或 Kling AI 3.0 [32]以合成人体操作视频最后VLM 会对每个生成视频在任务语义保留程度和物理合理性方面进行评估合格的人体视频将与其对应的原始机器人轨迹配对作为 ICL 样本最后对于上下文内 HumanGen 数据集HumanGen 是一个由人类-机器人 ICLIn-Context Learning上下文内学习对组成的数据集这些对是通过上下文内人类视频生成流程构建的。每一对都包含一个生成的人类视频指令以及其对应的机器人轨迹和可执行动作HumanGen 按数据来源进行组织分为预训练 ICL外部、预训练 ICL自建、仿真ICL 和真实世界 ICL。与用于构建 Task-diverse VA 数据时采用的多任务多样性采样原则一致源机器人视频是按“任务”而非按“原始轨迹出现频率”进行采样从而避免 ICL 数据被少数任务的大量重复执行所主导预训练 ICL外部。该子集基于与“任务多样 VA 数据”相同的五个公开机器人视频-动作数据集构建而成AgiBot [23]、InternData-A1 [24]、Open-X-Embodiment [4]、RoboCOIN [25] 和RoboMIND [26]这些数据集覆盖多样的机器人形态、场景和物体总计包含超过 45 种机器人形态作者按任务从每个数据集中采样机器人轨迹并利用“上下文内人类视频生成流程”将其转换为与之语义匹配的人类视频具体而言作者从 AgiBot 采样了 3,354 个任务和 6,660 条轨迹从 InternData-A1 采样了 261 个任务和 12,515 条轨迹从 Open-X-Embodiment 采样了438 个任务和 9,290 条轨迹从 RoboCOIN 采样了 512 个任务和 6,513 条轨迹从 RoboMIND采样了 497 个任务和 6,210 条轨迹总体来看Pre-train ICLExternal共包含 5,062 个任务和 41,188 对人类-机器人 ICL 样本对于该子集作者有意在视觉对齐上进行多样化在场景环境、桌面背景、物体实例与摆放方式等方面强制引入变化并在第一人称与第三人称视角之间进行平衡———由于在这些视觉变化下任务语义仍得以保持模型被迫去学习对场景、物体和视角变化不敏感的人类-机器人任务对应关系从而提升其在视觉多样 ICL 提示下的鲁棒性预训练 ICL内部数据。为了进一步提升任务覆盖度作者从自有的机器人数据集中按任务采样机器人的轨迹该子集涵盖多种机器人形态例如双臂 Franka 和 Galaxea R1 Pro包含 3,522 个任务和 30,247 个人机 ICL 对在使用情境内人类视频生成流程为该子集生成对应的人类视频时作者降低第三人称视角的比例并减少场景、物体以及物体摆放变化的频率这样在保持任务多样性的同时能够生成在视觉上更加对齐的 ICL 样本仿真环境下的 ICL为了在仿真中支持跨任务评估作者为 50 个 RoboTwin 任务 [22] 生成了 ICL 数据。该子集包含 2,500 个 ICL 样本每个任务 50 个样本其中43 个任务用于后训练共 2,150 个训练样本其余 7个任务被保留为未见任务用于零样本跨任务评估真实世界的 ICL真实世界 ICL 包含在人形双臂 Franka 评估平台上收集的人机配对数据它涵盖了 252 个人机 ICL 配对分布在作者评估中使用的三个真实世界任务族上来自 30组物体到容器放置训练任务组合的 120 个配对、来自 16 组三物体顺序操作训练任务组合的96 个配对以及用于双桌腿插入的 36 个配对该子集用于后训练以便模型能够拟合评估机器人运动学从而进行跨任务评估总结一下表 1 将 HumanGen 与现有的任务级人机配对数据集进行了比较其统计数据均来自各自的官方论文不同于以往依赖人工采集人类数据的数据集HumanGen 利用基于 in-context 的人类视频生成流程从机器人轨迹中自动生成在语义上匹配的人类视频从而实现大规模构建人机 ICLin-context learning配对数据HumanGen 还融合了多种数据来源公开数据、内部数据、仿真数据和真实世界数据涵盖显著更多的机器人形态包含来自第一视角和第三人称视角的人类数据并提供在视觉对齐程度上多样化的配对数据更为重要的是HumanGen 在任务覆盖范围上显著更广而这正是实现零样本跨任务泛化的关键因素1.2 Zero-WAM上下文零样本世界动作建模在零样本跨任务操作中机器人必须在不进行微调的情况下执行一个全新的任务作者通过一个在大规模人机ICL(in-context learning上下文学习)对齐数据以及任务均衡的机器人视频-动作数据上预训练的世界动作模型(World Action ModelWAM)来追求这一能力在部署阶段Zero-WAM 使用语言指令或人类视频示范作为任务规范从而驱动对未见任务的执行1.2.0 预备知识第一对于视频生成的流匹配对于视频生成flow matching [35] 在干净视频与高斯噪声之间的一条连续路径上学习一个速度场给定一个干净视频、噪声以及流动时间加噪后的视频和目标速度为在给定条件的情况下flow-matching 损失为在推理时通过从噪声开始并将学习到的速度场积分回来生成视频第二对于因果视频-动作建模作者遵循 LingBot-VA 系列工作 [11,12] 提出的因果视频-动作框架在该框架中每一个控制步都是一个因果预测问题在给定任务条件和历史观测的情况下模型预测机器人的下一段视频片段以及与其在时间上对齐的、可执行的动作片段每个机器人轨迹被分块为其中是一个视频块是时间对齐的动作块。作者在整个方法中使用分块级别的符号表示在实现中每个视频或动作块在进入Transformer 之前都会被编码为模态特定的表征并且注意力掩码作用在这些分词后的表征上。且使用表示任务条件它可以是语言指令或相同任务的人类视频指令在分块索引处因果模型预测下一个视频块以及对齐的动作块这一联合预测被分解为先进行视频预测然后进行动作解码其中预测下一个视频片段而作为一个逆动力学模型从预测的下一个机器人视频片段中解码可执行的动作训练期间模型被提供真实轨迹前缀并在下一个视频-动作片段上进行监督对于来自任务多样化V A 数据的轨迹条件是语言指令对于来自HumanGen 数据的轨迹条件是其中是相同任务的人类视频指令而是语言指令第三对于混合Transformer 设计作者在混合TransformerMoT设计下将和实现为视频Transformer和动作Transformer。每种模态都有其各自的参数包括独立的QKV 投影、FFN 和输出头而视频和动作表征保持在同一序列中并仅通过共享的注意力层进行交互。在该序列中动作块表征被放置在未来视频表征之后从而使动作解码能够关注预测的未来机器人视频这与上述分解方式的要求一致第四对于模型实例化遵循 LingBot-VA作者通过将Wan-2.2-TI2V-5B[36](一种双向文本/图像到视频生成模型)转换为上述因果视频动作策略来实例化 Zero-WAM基于这一框架本节其余部分将介绍 Zero-WAM 特有的两个组件作为上下文任务规约的人类视频以及基于上下文的未来片段预测1.2.1 以人类视频作为任务规范对于一个未曾见过的任务仅用语言完整描述期望的行为往往很困难而且指令还必须进一步被“落地”为策略从未观测过的任务动态因此作者采用人类视频作为一种上下文中的任务规范形式直接展示期望的动态在部署时一段演示该未见任务的人类视频即作为指令为了教会策略遵循这一接口作者在 HumanGen 数据集上进行训练该数据集通过在任务层面采样源机器人轨迹构建而成。每个语义匹配的样本对都包含一个生成的人类视频作为视觉任务规范以及其对应的机器人轨迹用于提供监督的未来视频和动作片段由于人类视频与匹配的机器人轨迹在具身形态、视角、背景和物体摆放上可能存在差异模型必须学习任务层面的对应关系而不是从人类视频中逐帧复制动作在训练过程中作者在人为视频片段、机器人视频片段和动作片段的分词表示上应用teacher-forcing 注意力掩码。人类视频被添加在机器人轨迹之前并作为机器人视频预测的前缀token在片段索引处video Transformer从上下文中预测下一个机器人视频片段对于下一个机器人动作片段的预测action Transformer根据机器人域历史和预测的下一个机器人视频片段来预测遵循「上节1.2.0」中的逆动力学分解它不会直接关注人类视频所传达的任务语义已经被吸收进预测的下一个机器人视频片段中因此动作解码简化为标准的逆动力学动作预测条件因此与标准的机器人视频-动作训练保持不变RoPE [37] 用于ICL 人类视频的偏移。ICL 人类视频和多视角机器人视频由同一个VAE 编码器编码因此共享相同的视觉潜在空间。在token 序列中作者通过高度轴RoPE 坐标来区分ICL 人类视频与机器人视频机器人视频潜变量保持其原始坐标而人类视频潜变量在高度轴上通过一个偏移量进行平移令表示视觉潜变量在时间、垂直和水平方向的坐标并令为多视角机器人视频潜在布局。作者将 RoPE 坐标指定为该偏移将人类视频的潜在表示放置在机器人视频潜在表示的坐标范围之外从而在人类视频用于 ICL与机器人视频在同一序列中交互时避免它们之间的表征混淆1.2.2 基于上下文的未来片段预测对于in-context 样本模型应该从人类视频h 中推断任务的演化并将其迁移到机器人域。然而在对已见任务进行teacher-forcing 训练时紧接着的下一个机器人视频片段往往可以通过外推最近的机器人历史(x≤i)来预测。这会产生一种捷径使得模型在不学习使用in-context 人类视频的情况下就能降低训练损失当模型在未见任务上进行评估时这种捷径会导致模型继续依赖机器人历史并在恰恰需要该信号来指定新任务时未能充分利用ICL 信号为对抗这种捷径作者从Next Forcing [14] 的多片段预测中汲取灵感引入in-context future chunk prediction (IFP)这是一种仅用于训练的辅助目标要求模型从当前的机器人视频表征中预测多个跨步的未来机器人视频片段令为时间步幅K 为需要预测的未来片段数量。第k 个未来目标机器人视频片段为其中目标索引定义为为了预测这些目标作者添加了个IFP 模块其中负责在流匹配目标下对第个跨步未来视频块进行去噪每个IFP 模块与视频分支中的单个Transformer 层具有相同的结构并从最后一个video Transformer 层进行初始化IFP 在由主分支生成的当前机器人视频表征上运行。在下预测当前机器人视频片段时作者从主视频Transformer 的M 个中间层收集机器人视频的隐藏表征令表示的收集到的特征表征其中是在流动时间下的加噪片段然后将这些多层表征拼接起来并通过一个轻量级的MLP 投影P fuse 将它们投射回单层隐藏维度每个IFP 模块Gk 在融合的当前表示、干净的机器人视频/动作历史以及语言指令的条件下预测其跨步的未来块IFP 损失将上述流匹配目标应用于每一个按步长抽取得到的目标其中用 w_k 表示第 k 个未来视频片段目标的损失权重重要的是IFP 模块并未直接以人类视频提示h 为条件。它们获取任务信息的唯一途径是通过而该表示是在主机器人视频Transformer 与上下文中的人类视频交互后提取的。如果IFP 模块被直接以h 为条件那么辅助分支就可以学习一个独立的、以人类视频为条件的未来预测器而不必迫使主机器人视频Transformer 去编码上下文中的任务信息由于IFP 模块在推理时会被移除那么部署的策略将无法从这种辅助监督中获得任何收益因此作者只以为条件来训练IFP使未来损失能够监督由主分支产生的当前机器人视频表示。多个未来片段以时间步长并行预测在不在训练中引入未来片段预测之间时间依赖的情况下提高了预测难度1.2.3 训练与推理首先对于训练数据混合作者在由任务多样化的 VA 和 HumanGen 数据构成的混合数据上训练 Zero-WAM任务多样化 VA 提供多种机器人领域的视频—动作动态数据而 HumanGen 则提供以可执行机器人动作为基础的人类视频任务规范。这两类数据并非按原始数据集规模比例进行采样而是使用设定的采样权重进行抽取其次对于训练目标对于每个目标下一个视频块采样噪声和流时间并形成在给定任务条件的情况下下一片段视频的损失为对于动作片段预测作者在动作空间中使用类似的流匹配目标。给定高斯噪声和流时间构造并优化对于任务多样的VA 样本条件是仅语言c ℓ损失为对于HumanGen 样本视频预测以为条件并结合上下文未来片段预测IFP进行增强。动作损失仍然以ℓ为条件因为动作Transformer 并不直接关注人体视频最后对于推理在测试时IFP 模块被移除Zero-WAM 支持两种任务指定模式在仅语言模式下模型以文本指令为条件即在ICL 模式下人类视频被编码一次其tokens 被缓存为前缀记忆因此模型以为条件其中语言指令是可选的在这两种模式下模型首先生成下一个机器人视频块然后解码对齐的动作块// 待更
返回列表