尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

当机器人学会走路,却依然找不到答案

当机器人学会走路,却依然找不到答案 先讲个场景。你养了一条机器狗它已经学会了在你家里到处溜达绕开茶几钻过门缝走到你指的任何一个房间都不带撞墙的。厉害吧现在你问它帮我看看客厅那个黑色沙发是不是脏了。它愣住了。不是它不会走路而是它不知道该往哪走走完之后该记住什么走了五个房间之后该不该放弃。这就是今天要聊的这篇论文想解决的问题一个能走的身体,和一个会想的脑子怎么才能真正配合起来干成一件复杂的事。**这篇论文的作者来自上海交通大学、阿里巴巴通义千问团队、阿德莱德大学、北京大学、清华大学等机构他们给这个问题起了个名字叫NavMCP。**它要解决的具体任务叫EQA*EQAEmbodied Question Answering具身问答让一个机器人在物理环境里到处走动去寻找视觉证据然后回答一个跟环境有关的问题比如卧室灯是开着的吗。*这事听起来简单做起来很难。因为答案往往不在你面前你得先找到它。先说说这个领域此前卡在哪。在NavMCP出现之前最强的方法叫FAST-EQA在HM-EQA这个基准测试上能拿到69.2%的准确率。而ToolEQA只有62.3%Memory-EQA在另一个数据集MT-HM3D上是43.1%。这些数字看起来还行但你换个角度想每答10道题FAST-EQA还要错3道。放在真实世界里这意味着机器人有近三分之一的概率跑遍了整个房子最后给你一个错的答案。问题出在哪呢论文作者观察到一个很有意思的现象。现在做具身智能的模型分成两大阵营。一边是VLM*VLMVision-Language Model视觉语言模型能看图、能读文字、能推理的AI模型比如GPT-4V这类擅长判断还缺什么信息该去哪找但让它直接控制机器人的每一步移动就会变得笨拙又低效。*另一边是NFM*NFMNavigation Foundation Model导航基础模型专门训练来执行走到某个地方这类导航任务的模型比如论文里用到的Qwen-RobotNav它能稳定地把一句话指令变成一段真实的移动轨迹但它自己不会规划长期任务也不记得之前发生了什么。*这两者其实是互补的。VLM懂得想什么NFM懂得怎么走。问题是怎么把它们粘合起来**直接把NFM当成一个普通的工具调用来用是行不通的。**论文里管这个叫episodic interface gap翻译过来就是一次性调用接口的缺口。具体来说有三个坑。第一个坑是指令和意图对不上。你让NFM执行一条走到厨房的指令,这条指令没法承载agent真正想表达的意图比如我在找一个咖啡机如果找不到就换个地方看看这种带条件、带目的、带预算的复杂需求一句路线指令根本装不下。第二个坑是中间观察全丢了。机器人走过去的路上,可能路过了一个物体瞥见了半开的门这些信息如果只在任务完成后返回一个成功或失败的状态中间看到的一切就全部作废了。第三个坑是没有跨轮记忆。每次调用NFM都是独立的一次性交易它不知道你之前搜过哪些房间排除过哪些猜测留下过什么疑点。这三个坑加起来会导致什么后果论文里做了一个关键实验把NavMCP换成一个纯粹的一次调用一次返回的episodic接口其他条件完全不变准确率直接从74.0%掉到59.1%跌了14.9个百分点。**这14.9个百分点就是这三个坑加起来的真实代价。**想象一下你雇了个特别聪明的侦探帮你找丢失的钥匙,但你们之间的沟通方式是你说一句去卧室看看侦探进去转一圈出来只告诉你没找到中间路过客厅时看到的那个可疑的包看到的那扇没关的窗户全部不告诉你。而且每次派他去一个新地方他都完全忘记之前去过哪儿。这样的侦探再聪明破案效率也会大打折扣。如果不解决这三个坑再强的VLM也只是在盲人摸象。三条通道把断裂的沟通接起来NavMCP的解法是设计了三条通道专门用来补上这三个坑。第一条叫意图通道。VLM不再需要直接控制机器人的每一步它只需要发出一个结构化的语义导航调用里面写清楚模式、目标、预算、限制条件。比如搜索厨房台面找咖啡机最多走64步。这个调用支持两种模式一种是navigate_to_object指名要找什么物体另一种是navigate_by_instruction描述一段路线或一个区域范围。这就好比你给外卖骑手发指令不是让他每一步都听你指挥往左拐往右拐而是直接告诉他送到3号楼502预计20分钟内到剩下的路线规划交给他自己判断。如果反过来你事无巨细地遥控骑手每一步动作效率反而会更低而且骑手一旦遇到你没预料到的岔路就会卡住。第二条叫观察通道。它解决的是路上看到的东西不能丢这个问题。执行器每完成一次导航会沿途每隔4步采样一次画面,最多保留16张关键帧,然后用一个VLM把这些画面转换成一份有据可查的旅程记录里面写清楚走过了哪些房间、看到了哪些物体、还有哪些出口没探索过。关键的是,每一条物体或房间的描述,都必须绑定到具体的某一张源图片上还要标注置信度。论文里特别强调这个总结器被明确要求只报告视觉上真实观察到的证据明确标注不确定性不要把单次视角里没看到就当成确定的否定证据。这一点其实很值得琢磨。你去朋友家找一本书进了卧室扫了一眼没看到你能不能直接断定这本书绝对不在这个房间不一定可能它就藏在你没扫到的书架背面。这就是为什么系统要求否定证据必须来自系统性的、覆盖到位的搜索而不是一眼没看见就草率下结论。如果不做这个区分机器人很容易把暂时没看见误判成根本不存在进而给出错误答案。第三条叫记忆通道。这条通道把观察通道产出的证据沉淀成一份可持续更新的状态,论文里叫EQA context state,里面包含三块内容一份紧凑的交互历史一份带来源标注的证据台账还有一份待办事项清单记录还没解决的搜索目标。这就像你破案时随身带的笔记本每查完一个地方就把客厅已查无黑沙发这样的结论写下来而不是全靠脑子记。等你查到第五个房间时翻开笔记本一眼就知道前四个房间的结果不用再靠回忆去拼凑。系统还有个保守压缩策略只有当信息已经被提炼进证据台账之后原始的、冗长的工具返回记录才会被精简替换掉。这样即使上下文长度受限需要裁剪裁掉的也是已经被消化过的原始数据而不是关键结论。三条通道合起来机器人从一次性完成一个任务的执行器变成了能持续积累经验的搭档。图3里画得很直观VLM先冒出一个疑问需要确认下灯是否开着通过意图通道变成结构化的导航调用执行器跑完一趟通过观察通道把卧室已进入台灯已发现状态待确认这样的结果反馈回来最后通过记忆通道把这些结论写进下一轮决策要用的状态里。数据说话三个基准测试全面领先方法讲完了效果到底怎么样论文在三个EQA基准上做了测试。HM-EQA包含500道选择题覆盖267个HM3D场景MT-HM3D引入了需要跨房间比较的多目标问题EXPRESS-Bench则包含2044道开放式问题用LLM Score评判答案质量用Epath评判探索路径的效率。| 方法 | HM-EQA准确率 | MT-HM3D准确率 | EXPRESS-Bench LLM Score ||---|---|---|---|| Explore-EQA | 58.4% | 36.2% | – || Memory-EQA | 61.4% | 43.1% | – || ToolEQA | 62.3% | – | 65.77 || FAST-EQA | 69.2% | 50.5% | 68.7 || **NavMCP本文** | **76.7%** | **54.4%** | **79.27** |NavMCP在HM-EQA上比FAST-EQA高出7.5个百分点在MT-HM3D上高出3.9个百分点在EXPRESS-Bench上高出10.57分。而且更让人意外的是这些提升并不是靠堆砌更多计算换来的。论文设计了一套步数核算方法专门用来衡量高层决策的效率。简单说就是数VLM需要动多少次脑子而不是数机器人的物理步数。按照这套核算NavMCP在HM-EQA和MT-HM3D上用的归一化步数只有0.15和0.19是所有方法里最低的。也就是说NavMCP不仅答得更准思考的次数还更少。为了排除是不是因为对比的模型本身太弱这种质疑论文还专门做了一次对齐实验让Explore-EQA、ToolEQA、FAST-EQA和NavMCP全部用同一个Qwen3.5-397B-A17B作为推理大脑跑一样的场景、一样的初始状态、一样的预算。结果NavMCP还是以74.0%的准确率领先比排名第二的FAST-EQA复现结果高出10.5个百分点。这说明什么说明领先的不是用了更强的大模型而是这套三通道协作机制本身在起作用。VLM和NFM谁也离不开谁论文还做了一组特别有意思的对照实验专门验证VLM大脑和NFM身体是不是真的互补而不是随便哪个强就行。固定住导航执行器不变只升级上层的推理能力完全没有agent介入只让VLM看初始画面直接回答准确率只有38.2%给它一次全景扫描的机会涨到58.4%再给一个固定探索循环的反应式agent涨到62.0%换成完整的Qwen3.5协调框架直接跳到74.0%再换成Qwen3.6-Plus涨到76.7%。反过来固定住完整的VLMNavMCP框架不变只升级下层导航能力随机游走只有60.9%用前沿探索算法Frontier Exploration能到65.3%换成StreamVLN能到69.3%换成Qwen-RobotNav-4B能到73.3%换成8B版本74.0%。**这两组数据摆在一起结论就很清楚了单边变强都撑不起整体表现两边必须一起进步。**这跟很多人对越大越好的直觉认知是有出入的。你可能以为只要换个更强的大模型接口成绩就能突飞猛进但数据显示如果执行层还是随机游走哪怕大脑再聪明也只能拿到60.9%左右的分数。反过来哪怕执行器再精准没有一个能持续规划、积累证据的大脑在上面协调分数直接腰斩到38.2%。这就好比一个乐队主唱唱得再好如果鼓手一直乱打节拍整首歌照样毁掉反过来鼓手再稳主唱一直跑调观众也听不下去。论文里图4展示了一个真实的搜索过程题目是找一个小黑沙发。机器人先后搜索了五个房间在每个房间都留下否定证据避免重复搜索最后在第20回合切换成针对物体的精准搜索在第25回合于卧室角落找到了目标。整个过程中距离目标的曲线是非单调的,机器人不断远离目标去排除其他可能的房间,最后才收敛到答案上。这种看似绕远路实则在排除干扰项的行为恰恰体现了这套系统真正在做主动的证据驱动搜索而不是盲目瞎撞。拆掉每一块积木看看谁在扛大梁光看整体效果还不够论文进一步做了消融实验逐一拆掉三条通道的某个部件看每一块到底贡献了多少。| 拆掉的部分 | 准确率 | 相比完整系统的下降 ||---|---|---|| 完整系统 | 74.0% | – || 换成一次性episodic接口 | 59.1% | -14.9 || 观察通道只返回终止状态 | 68.1% | -5.9 || 去掉旅程分析总结 | 69.6% | -4.4 || 去掉EQA上下文状态 | 69.4% | -4.6 || 关键帧稀疏采样 | 71.2% | -2.8 || 只保留一种导航模式 | 72.0% | -2.0 || 去掉上下文压缩 | 73.1% | -0.9 || 去掉物体放大检查工具 | 73.4% | -0.6 |从这张表能看出观察通道和记忆通道贡献最大各自单独拆掉都会损失4到6个百分点。这符合直觉如果机器人走过一段路却什么都记不住那走再多趟也是在原地打转。论文的按类别分析也很有意思。存在性问题问某物存不存在和识别问题准确率都超过80%状态判断问题也有77.2%但计数类问题只有65.0%是最弱的一项。原因是多张关键帧可能拍到了同一个物体机器人容易把重复看到的同一个东西误当成好几个不同的物体来数。这提示未来还需要更强的跨视角物体关联能力。从虚拟仿真走到真实机器狗前面所有实验都是在仿真环境里跑的论文还专门在一台Unitree Go2真实机器狗上做了实测验证这套方法能不能扛住现实世界的传感器噪声、里程计漂移和长距离行走的挑战。实验设计了六种任务分成三个难度档低难度是单房间内的证据搜集比如查一个背包上的品牌标志中难度是跨房间搜索比如查会议室里屏幕投影的验证码高难度是超过20米的开放场景探索比如数电梯厅里有几部电梯。| 难度层级 | 反应式基线 | Frontier探索基线 | NavMCP ||---|---|---|---|| 低单房间 | 80% | 70% | **90%** || 中跨房间 | 35% | 60% | **85%** || 高超20米 | 0% | 15% | **60%** || 总体 | 38.3% | 48.3% | **78.3%** |这张表最值得琢磨的地方是随着任务难度上升NavMCP的优势不是线性扩大而是加速扩大。在最简单的单房间任务里NavMCP领先反应式基线只有10个百分点到了跨房间搜索领先扩大到25个百分点甚至更多到了超过20米的长距离任务反应式基线直接归零而NavMCP还能保住60%的成功率领先幅度扩大到45个百分点以上。这个现象背后的道理不难理解。任务越短就算没有记忆能力靠运气蒙对的概率也不低。但任务一旦拉长需要多轮搜索、多次排除、跨房间比对信息没有记忆和持续规划能力的系统就会迅速崩溃因为它每走一步都在失忆重启。这就像考试一道选择题就算瞎蒙也有四分之一的机会对但一道需要连续推理五个步骤的大题只要中间有一步断片全盘皆输。论文里附了一个特别长的真实案例用户让机器人去一家叫Cotti Coffee的咖啡店查看自己是否落下了一把绿色雨伞还要留意路上看到的有趣的东西。整个轨迹超过50米机器人先观察周围环境获取初始定位识别关键地标后决定右转穿过走廊中途还发现了一个新地标阿里巴巴logo最终锁定咖啡店位置走近后确认看到了绿色雨伞。这个过程完整走了34个回合的规划与执行循环是仿真实验里从未测过的超长距离场景也直观展示了这套三通道协作机制在真实世界里到底是怎么运作的。写在后面读完这篇论文最触动我的一点其实不是这套三通道设计本身有多精巧而是那14.9个百分点的对比实验揭示的一件事很多AI系统看起来能力不足可能压根不是模型不够聪明而是接口设计砍掉了它本该拥有的信息。同样的VLM同样的NFM仅仅因为中间的沟通协议从一次性黑盒调用换成带记忆、带证据、带意图的协作机制准确率就能差出15个百分点。这提醒我一件事升级AI系统未必总要换更大的模型有时候只是把两个已经足够聪明的模块之间的沟通方式理顺收益就已经很可观了。另一个让我意外的细节是论文里那条否定证据的判定规则。系统被明确要求不能因为这一眼没看到就断言东西不存在必须要有系统性搜索覆盖的支撑才能下否定结论。这其实是个很朴素但常被忽略的认知陷阱人类自己判断事情的时候也经常犯觉得我扫了一眼没看见就等于不存在。把这条规则显式写进AI系统的设计里某种程度上也是在提醒我们自己该怎么更严谨地下结论。真实机器人实验里那条难度越高、优势越大的曲线也让我重新想了一下长期记忆这件事的价值到底体现在哪。短任务里差距不明显长任务里差距炸开这说明记忆和持续规划能力不是锦上添花的功能而是决定一个系统能不能扛住复杂世界的分水岭。那条会走路却不知道该记住什么的机器狗如果有一天它真的养成了边走边想边记的习惯你会先问它什么问题QAQ1NavMCP是什么ANavMCP是一个脚手架式框架把负责推理的VLM大脑和负责导航执行的NFM导航基础模型结合起来通过意图、观察、记忆三条通道让二者协作完成需要长时间探索的物理世界任务比如具身问答。Q2NavMCP在实验中表现如何A在三个EQA基准测试里全部达到最优HM-EQA准确率76.7%比此前最强方法FAST-EQA高7.5个百分点真实机器狗测试总成功率78.3%且任务越长优势越明显最高领先45个百分点。Q3为什么普通的工具调用接口不够用A普通的一次性调用只返回成功或失败的终止状态会丢失路上看到的中间信息也没法承载复杂的搜索意图更不能在多次调用之间积累经验。论文实验显示换成这种简单接口后准确率直接跌了14.9个百分点。
返回列表