李弘扬老师,在RSS上对具身智能的最新思考。

发布时间:2026/7/30 14:34:55

李弘扬老师,在RSS上对具身智能的最新思考。 今年 RSS 上香港大学助理教授、源策未来创始人李弘扬获得了 Early Career Spotlight并在随后的演讲中系统介绍了他对全身智能 Whole-Body Intelligence也就是 WBI。之前业内的叫法都是全身控制whole-body control弘扬老师这次提了一个升级的概念。我们觉得很有意思所以这篇文章想和大家讨论一下。过去几年机器人已经陆续学会了走路、跑步、导航和抓取。这些能力单独看都在快速进步。人形机器人可以稳定行走机械臂能够完成灵巧操作VLM 和 VLA 也能接管高层任务理解与动作生成。可真实的现状是机器人进入复杂场景仍然不 work。举一个例子搬一辆很重的自行车侧身穿过狭窄通道时弯腰拿沙发下面的东西等等。这些任务很难被简单拆成“移动一次再操作一次”。机器人需要根据目标、环境和自身状态实时决定全身各个部位应该如何配合。李弘扬老师将这种能力称为全身智能并把它视为机器人领域下一座需要攻克的高山。从整场演讲来看WBI 并不单单是一个新的技术名词。围绕这个概念李弘扬其实给出了他对具身智能下一阶段的判断机器人应该学习什么样的行为泛化能力从哪里来模型与控制如何分工仿真和真实数据各自承担什么角色以及硬件距离真正可用还有多远。原文链接李弘扬老师在RSS上对具身智能的最新思考。01从全身控制走向全身智能理解 WBI首先需要区分它和传统全身控制 WBC 的关系。WBC 主要解决的是动作的物理可行性。给定一段参考运动控制器需要保证机器人不摔倒、接触力合理、关节能够实时跟踪最终让这段运动稳定地执行出来。它关注的是「这个动作能不能做」。WBI 需要回答的问题更复杂面对一个新的任务机器人应该如何调动整个身体自主组织出一段合适的行为。它关注的是「为了完成这个任务整个身体应该怎么动」。两者之间并不是简单的能力高低关系WBC 依然是 WBI 的基础。没有稳定的平衡、跟踪和接触控制再聪明的上层模型也很难落到真实硬件上。但只有 WBC 也不够。传统控制器擅长执行一段已经设计好的参考动作却很难根据开放环境和语义目标主动发现“另一只手应该撑住沙发”“身体应该侧过来”“需要利用全身重量向后拉”这类行为。这也是李弘扬老师强调的关键WBI 不是手臂操控和腿部行走的简单相加。在真正的全身任务中身体不同部分的作用会随着环境实时变化。每一个局部动作都可能改变全身的质心、可达范围和受力状态。机器人最终需要学习的是这些动作之间的耦合关系。围绕这一目标李弘扬提出了一套以预训练为中心的四层架构。最上层是 System 2负责语义理解、记忆和长期规划将复杂指令拆解成更具体的子目标。向下是 System 1也就是原生的人形基础模型。它接收视觉信息与身体状态直接生成各个身体部位的动作。System 0.5 负责提供行为先验和动作约束生成可以参考的运动模式。最底层的 System 0 则是传统全身控制系统确保动作最终能够稳定、实时地在机器人上执行。这套架构背后有一个值得关注的系统层面的判断。具身智能很难被做进一个模型之中。高层语义、全身行为生成、身体先验和底层控制分别面对不同的时间尺度、数据分布与物理约束。真正可用的机器人系统可能需要让多个层级共同工作而不是期待一个VLM或者WAM直接接管所有关节。从 WBI 的角度看它们更像系统中不同位置的组件。02人类数据可能才是泛化的核心引擎在整场分享中李弘扬有一句话非常值得大家关注人类数据绝对不是具身智能的「配菜」它就是泛化能力的核心引擎。Human-Centric 的数据已经成为当下具身行业Scaling的核心共识我们在这里也不再过多强调。泛化需要的不只是更多动作样本还需要更大的行为分布。人类中心数据的价值正在这里。李弘扬介绍的 EgoHumanoid正是在超市、户外和家庭等真实场景中采集第一人称交互数据。团队还使用超过 10 万小时的数据、3000 多个环境和700多个角色进行人类与机器人协同预训练。按照李弘扬老师的判断未来 WBI 的训练数据中人类中心数据可能占到 80%至90%机器人自身的原子技能数据占10%至20%最后再通过机器人策略完成后训练。这个比例未必是黄金配比但它清楚地表达了不同数据的作用人类数据负责扩大模型看到的世界让模型获得更加广泛的行为先验机器人数据负责完成从人类身体到具体本体的适配后训练则让策略在真实交互中学会处理失败和长尾情况。泛化也并不意味着一个模型预训练完成后就可以在所有环境里直接工作。更现实的路线可能是先从人类数据中学习广泛先验再通过少量机器人数据完成身体对齐最后依靠部署后的反馈不断适应。03硬件距离完美还有 Gap模型和数据在快速扩张机器人硬件的问题却没有因此消失。李弘扬在演讲中提到即使是当前部署规模较大的优秀机器人在实际测试时依然会遇到无线通信丢包、关节过流保护、电机过热等问题。这些听起来像普通的工程故障但到了 WBI 阶段影响会被进一步放大。在单臂操作任务中一个关节失效可能意味着这次抓取失败。对于全身任务一个局部异常可能会迅速传导到整个身体。手臂突然停止会打破身体的受力平衡通信延迟会破坏上下肢之间的动作同步电机过热会限制机器人持续搬运和发力传感器噪声则可能让模型错误判断身体状态。全身智能越强调身体各部分的耦合系统对硬件稳定性的要求就越高。这也是为什么 WBI 需要的不只是「超级大脑」还要有一具「强壮的身体」。这里的强壮并不只意味着更大的峰值扭矩或者更高的负载还包括长期运行的可靠性、低延迟通信、全身传感器的同步、持续功率输出、热管理以及出现异常后的安全恢复能力。所以硬件成熟度不是 WBI 之外的工程问题它本身就是全身智能能否成立的一部分。04具身智能正在进入系统级 Scaling在现场问答中李弘扬还给出了几个更具趋势性的判断。首先是仿真与真实数据的边界。仿真在训练下肢行走、平衡和底层控制器时非常有效。任务规则清晰物理约束相对明确训练也可以大规模并行。但当目标转向 System 1 和 System 2让机器人理解复杂语义、开放环境和千变万化的任务时现阶段仿真能够提供的价值依然有限。高级智能需要面对真实世界中的物体分布、行为逻辑和长尾情况这些内容很难在仿真中完整构造。因此仿真会继续承担底层运动 Scaling真实世界数据则决定高层智能能够走多远。世界模型可以改善训练效率却很难凭空创造真实数据中不存在的行为分布。第二个判断是全身智能需要专门的全身数据。现有视觉大模型掌握了大量语义知识局部操作数据也能教会机器人完成抓取和移动。但这些数据中没有完整的全身动力学协同。当两条腿负责支撑躯干调整姿态两只手完成不同角色时各部分状态必须在同一个时间轴上被共同记录。机载相机、IMU、全身关节状态以及环境交互信息都会成为数据流水线的一部分。只把手部和腿部数据分别收集起来事后再进行拼接很难恢复动作发生时真实的全身耦合。第三个判断是具身系统必须具备持续改进的能力。李弘扬所说的持续学习更强调机器人在物理世界中的闭环反馈。机器人进入新环境、遭遇新任务或出现失败后需要把这些负反馈重新变成训练数据让模型不断迭代。这意味着部署不是训练流程的终点而是新一轮数据生产的开始。真正有竞争力的系统可能不是第一次部署时成功率最高的模型而是能够长期收集失败、完成更新并逐渐适应更多场景的机器人平台。最后WBI 会是一场模型、数据、算力和硬件共同参与的 Scaling。李弘扬给出的预测是实现 WBI 的全面爆发可能需要大约 100 亿参数的模型、超过10万小时的高质量人类数据以及500至1000张H200级别的GPU。这些判断我们认为值得大家认真思考。05写在最后过去我们习惯把机器人能力拆成行走、导航、操作和控制。这种拆分推动了每个方向的快速进步也让机器人逐渐具备了一系列专业技能。但真实世界中的任务并不会严格按照技术模块的边界出现。机器人要搬动重物、穿过狭窄空间、弯腰拿取目标或者在失去平衡时借助环境恢复。它需要围绕同一个目标理解并调动自己的整个身体。从这个角度看WBI 的提出有很高的价值。所以李弘扬老师在尝试重新定义机器人学习的基本单位。未来机器人需要掌握的一定是自主组织出来的完整行为。毕竟具身智能最终需要进入的还是物理世界的身体。重磅全网首个具身智能开源知识库来啦技术/产业/投融资/上下游推荐阅读真机强化入门的一套完整教程pi*0.6复现方案我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务具身智能的WAM与世界模型一份完整指南一览具身智能的行业全局从产品经理的角度出发VLARL方向首个系统教程来啦Online RL/Offline RL/test time RL等好用高性价比面向具身科研领域打造的轻量级机械臂VLA/VLA触觉/VLARL/具身世界模型等具身大脑小脑算法与实战全栈路线来啦~从零训练你的足式机器人让你的足式机器人真正动起来~1v1 科研论文辅导来啦重磅具身智能之心论文辅导来啦近20方向顶会/顶刊/SCI/EI/中文核心/申博等

相关新闻