尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

π0.7​:一种具备涌现能力的可控通用机器人基础模型

π0.7​:一种具备涌现能力的可控通用机器人基础模型 机器人基础模型的演进对通用机器人策略的追求通常被称为机器人基础模型或视觉-语言-动作VLA模型是现代人工智能的核心主题。这些模型旨在为机器人提供与大型语言模型相同的广泛能力和推理水平使其能够在多样化的环境和机器人平台上操作。尽管π0\pi_0π0​、π0.5\pi_{0.5}π0.5​和π0.6\pi_{0.6}π0.6​等早期版本通过集成预训练的视觉-语言架构和分层规划取得了一些进展但它们往往在组合泛化能力上表现不佳——即以新方式组合已知技能来解决不熟悉问题的能力。大多数现有模型需要针对特定任务进行微调才能可靠运行这限制了它们在实际场景中的灵活性。π0.7​模型代表了该领域的进步它侧重于“可控性”和上下文条件设定以克服这些限制。通过扩展在训练和推理过程中提供给模型的信息研究人员开发了一种策略该策略无需专门的后期训练即可展现出涌现能力。这种方法使机器人能够遵循复杂的、开放式的指令并“开箱即用”地在不同机器人本体之间转移灵巧技能跨实体转移。这项工作的意义在于它从僵化的任务定义转向了一种新的范式即机器人可以通过语言和视觉目标进行“指导”。架构与多尺度记忆系统π0.7\pi_{0.7}π0.7​模型是一个拥有50亿参数的VLA建立在一个强大的架构基础之上。它利用一个40亿参数的视觉-语言模型VLM骨干网络该骨干网络从Gemma3初始化包含一个4亿参数的视觉编码器。这个骨干网络负责处理视觉观察和高级指令提供复杂交互所需的语义理解。为了处理时间上下文——这对于需要记住过去状态或序列的任务至关重要——π0.7\pi_{0.7}π0.7​整合了一个名为多尺度具身记忆MEM的系统。MEM系统可以处理来自多个摄像机角度包括前视图和腕部安装视图的最多六个历史帧。这些帧被压缩成固定数量的令牌使模型能够在不以原始数据淹没主Transformer的情况下保持情节的连贯历史。实际的运动控制由一个8.6亿参数的“动作专家”Transformer处理。该专家通过流匹配目标进行训练以预测连续动作这是一种通过学习对动作序列去噪来生成平滑精确轨迹的技术。训练过程的一个关键特性是“知识隔离”KI。在此设置中VLM骨干网络受到离散令牌的监督但来自动作专家的梯度不会回流到骨干网络中。这可以防止运动控制的高频噪声降级VLM中存储的稳定语义知识。通过多模态上下文实现可控性π0.7\pi_{0.7}π0.7​的核心创新在于其扩展的上下文条件设定策略。模型不再只接收简单的语言命令而是在每个时间步ttt接收一个丰富、多模态的提示CtC_tCt​作为条件。这个提示定义为Ct(ℓ^t,gt,m,c) C_t (\hat{\ell}_t, g_t, m, c)Ct​(ℓ^t​,gt​,m,c)其中ℓ^t\hat{\ell}_tℓ^t​代表子任务指令是中间语义步骤例如“去拿把手”而不是仅仅“开门”。gtg_tgt​表示子目标图像描绘了环境的期望未来状态。mmm代表剧集元数据包括质量评分和速度。ccc指定控制模式例如关节级别或末端执行器控制。通过包含子目标图像gtg_tgt​模型接收到空间接地的目标。这些图像在运行时由一个单独的拥有140亿参数的世界模型gψg_\psigψ​生成该模型接收当前观测oto_tot​和指令生成目标的视觉表示gtgψ(ot,ℓ^t,m) g_t g_\psi(o_t, \hat{\ell}_t, m)gt​gψ​(ot​,ℓ^t​,m)这种“目标条件化”GC使得模型即使在语言指令模糊不清时也能理解任务的物理要求。在训练过程中采用了一种名为“提示丢弃”prompt dropout的技术随机省略CtC_tCt​的部分内容。这确保了π0.7\pi_{0.7}π0.7​保持鲁棒性即使人类教练或世界模型只提供部分信息也能正常工作。从次优和多样化数据中学习机器人学习面临的一个主要障碍是高质量演示数据的稀缺。大多数模型都是在“专家”数据上训练的这使得它们在遇到错误或异常状态时变得脆弱。π0.7\pi_{0.7}π0.7​通过有意地整合次优和异构数据来解决这个问题包括失败的剧集、来自先前模型的自主运行以及以自我为中心的人类视频。为了防止这些质量较低的数据混淆模型研究人员使用了剧集元数据mmm。每个训练剧集都标记有“整体质量”1到5分、“整体速度”和“错误”等属性。在训练过程中模型学习这些标签与由此产生的动作之间的相关性。在推理时模型会收到“质量5”和“错误false”的提示有效地“引导”它以专家的精确度执行任务即使它已经见证了许多失败。这种元数据策略还允许无分类器引导CFG。通过对比模型在提示“高速”与“低速”时的输出研究人员可以在动作生成过程中放大期望的行为从而实现更高效、更果断的机器人运动。涌现的灵巧性和指令遵循能力研究人员在各种机器人系统上评估了π0.7\pi_{0.7}π0.7​包括双臂移动机械手和静态六自由度机械臂。最引人注目的发现之一是π0.7\pi_{0.7}π0.7​匹配或超越了“专家”模型的性能——这些模型是专门为洗衣折叠或浓缩咖啡制作等单一任务进行微调的。在涉及多种语言遵循能力的测试中π0.7\pi_{0.7}π0.7​显著优于其前身π0.5\pi_{0.5}π0.5​和π0.6\pi_{0.6}π0.6​。它展示了遵循“复杂指代指令”的能力例如“拿起最大盘子里的水果”。这种能力得益于世界模型当π0.7\pi_{0.7}π0.7​被赋予一个生成的子目标图像被称为π0.7 (GC)\pi_{0.7} \text{ (GC)}π0.7​(GC)时它在这些复杂任务上的成功率显著提高。此外该模型还展示了它能够克服强大的数据集偏差。例如在“反向冰箱到微波炉”任务将物品从冰箱放入微波炉中这与常见的训练模式相悖π0.7 (GC)\pi_{0.7} \text{ (GC)}π0.7​(GC)成功了而标准 VLA 模型则失败了。子目标图像提供了必要的视觉“锚点”以覆盖模型执行更常见反向动作的统计趋势。零样本跨载体迁移真正的基础模型的一个标志是能够将技能迁移到不同的物理形式上。π0.7\pi_{0.7}π0.7​实现了复杂双手任务的零样本迁移。例如它可以在双手 UR5e 机器人系统上折叠毛巾和衬衫尽管它从未针对该特定硬件进行过洗衣数据的训练。该模型不仅仅模仿了其他机器人的动作它还根据新的载体进行了调整。在 UR5e 上折叠时π0.7\pi_{0.7}π0.7​自然地采用了更适合 UR5e 运动学的垂直抓取方式而不是在其他机器人的源数据中观察到的倾斜抓取方式。在这些设置中π0.7 (GC)\pi_{0.7} \text{ (GC)}π0.7​(GC)的表现被发现与首次操作 UR5e 的经验丰富的人类远程操作员相当。组合泛化和人类指导π0.7\pi_{0.7}π0.7​的灵活性允许“通过提示教学”的工作流程。对于模型从未见过的长程任务——例如“烤面包圈”或“装载空气炸锅”——人类可以充当教练提供分步的子任务指令。由于模型理解这些语义子步骤它能够执行任务每个阶段所需的物理动作。有趣的是研究人员发现在模型通过某个任务进行几次指导后生成的数据可以用于训练一个高级语言策略。然后该策略会自动提供子任务指令ℓ^t\hat{\ell}_tℓ^t​从而使π0.7\pi_{0.7}π0.7​能够完全自主地执行曾经未见过的长程任务。结论π0.7\pi_{0.7}π0.7​的开发标志着机器人学界处理通用智能方式的转变。通过专注于利用多模态上下文和多样化甚至是次优的数据的可控架构研究人员创建了一个在任务和载体之间以高成功率泛化的模型。虽然零样本任务的成功率60-80%目前低于训练分布内的任务90%但模型通过语言和视觉目标进行指导的能力为改进提供了明确的途径。用户无需收集数千个新的机器人演示而是可以通过简单的提示和高级指导来潜在地完善机器人行为。这种向更具交互性和灵活性的基础模型迈进使该领域更接近能够适应人类环境不可预测性的机器人。
返回列表