尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

机器人看29s视频学会一个新技能,自变量开源HOST框架

机器人看29s视频学会一个新技能,自变量开源HOST框架 最近有小伙伴跟我吐槽做 Agent 最崩溃的每遇到一个新任务还是得重写 Prompt、改 Workflow、重新调试。他说这话的时候我刚看完自变量机器人开源的新项目HOST让机器人只看一段人类示范视频就能获取新技能原技能也几乎不受影响。我们聊完一致认为这不就是 Agent 该有的样子吗这个项目全称叫 Human-to-robot One-Shot Skill AcquisiTion人类到机器人单样本技能获取。论文给出的数字更直接HOST让机器人看一段平均29s的人类视频就能学会一个新技能成功率 62%比花 4个多小时后训练微调的模型还高。相比微调模型的方案HOST让新技能学习提速了500倍数据却只需 1/50。接下来我们详细聊一聊它是怎么做到的。01 HOST凭什么看视频学会技能之前也不是没人试过让机器人看视频学技能但效果一直不理想。原因有两个。第一人和机器人动作节奏不一样。人倒杯水可能用3秒机器人执行同样的动作可能需要5秒。如果按时间对齐机器人看到的人类动作和它当前正在做的动作完全对不上。第二人和机器人身体结构不同。人类的手臂和六轴机械臂完全不同直接模仿动作根本行不通。之前的方法基本就是硬学——把视频帧压缩成特征直接映射到机器人动作。结果就是效果差、成功率低。HOST换了个思路。它先不管时间而是管进度。什么意思就是把倒水这个任务抽象成一系列进度状态开始→拿杯子→倾斜→水流出→停止→放回。不管你是人还是机器人只要在完成同一个任务你们就在同一个进度标尺上。HOST用一个自监督学习的对齐模块把人类视频和机器人轨迹映射到这个共享的任务进度流形上。然后视频不再是旁观者而是领航员。机器人当前执行到任务进度的哪个阶段HOST就去视频里找对应阶段的下一帧然后让机器人跟上视频的进度。更进一步HOST不直接学从视频到动作的映射而是拆成三步机器人先找到现在做的事情对应任务视频中的哪个位置根据人类做任务的视频画面想象如果是机器人自己做动作接下来应该看到什么画面这一步视角、本体构型都要转换过来是最难的一步。从想象出的机器人视角画面推导出要实现这个画面需要做出的具体动作。这个过程叫做自定位级联预测。说白了就是先搞清楚自己到哪儿了再想象这个动作如果是自己做应该看到什么将结果反推出动作最后指挥自己的手去做。这套逻辑跟人类“观察学习”的方式非常接近不是模仿动作本身而是从看到的结果依照经验想象哪些动作能实现。02 三个“惊喜数字”碾压主流微调方案HOST在50个全新的操作任务上做了测试——这些任务的技能在训练数据里完全没出现过涵盖不同物体、不同工具、不同操作方式。结果有三个数字让我印象深刻。第一个数字62%。HOST从一段人类视频学会新技能平均成功率62%。而同类从视频学习的最强模型AWDA也是不微调、直接推理成功率只有19%。HOST直接提升了43个百分点。更狠的是第二个数字507倍。主流的模型Pi-0.5SFT用50条遥操作演示做微调成功率只有38%还需要4小时才能完成。HOST用一段29秒人类视频演示无需针对新任务重新微调模型权重学会技能的成功率就达到62%。数据效率提升了50倍时间效率提升了507倍。你能想象这意味着什么吗以前教机器人学一个技能的时间现在够HOST学500多个技能。第三个数字99%。HOST学会新技能后在之前已经掌握的任务上保持了99%的原始成功率。而最强的微调基线呢学完新技能后之前技能的保留率只有40%一路学一路忘。为什么因为HOST整个技能获取过程不更新任何模型参数完全是在推理过程中进行的。机器人只要看到任务视频就能非常低成本地学习、复现技能。视频本身就是技能的“存储介质”。这意味着什么意味着机器人可以持续累积技能同时避免因反复更新模型参数而造成传统的灾难性遗忘。03 机器人进家庭最缺的就是“现学现做”讲真HOST最让我兴奋的不是那些数字而是它对机器人进入家庭这件事的推动。你想一个家庭机器人要面对的场景有多复杂今天你可能让它帮忙叠衣服明天可能是摆餐具后天也许是收拾玩具。这些任务听起来一样但实际面对的细节、做法可能都有不同。同样是叠衣服你可能想让机器人叠出你习惯的做法。你不可能为每一个新任务都采集几十条遥操作数据、花几个小时微调。家庭环境里最自然的学习方式是什么就是人类演示。你直接在机器人面前演示一遍“看这样收拾。”机器人看完很快就会了。这才是普通家庭能接受的交互方式。不需要编程知识不需要遥操作设备像人与人交流一样传递技能。写在最后回过头看HOST做的事本质上是范式跃迁从训练时微调循环走向推理时技能获取。在自变量机器人团队看来具身智能想要真正走出实验室、进入普通家庭就不能一直依赖专业人员采集数据、反复训练模型。人与人之间传递技能最自然的方式就是做一遍给对方看机器人也应该如此——把原本属于少数工程师的专业流程变成普通人用一段视频就能完成的教学。目前团队已经公开了HOST的论文和核心代码包含了完整的模型训练和离线数据处理组件如果感兴趣的可以去看看。让机器人落地迈上下一个台阶的可能就是这些技术。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表