
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读视觉语言导航VLN正在经历一个明显的矛盾越大的视觉语言模型越擅长理解长指令、地标和空间关系却越难以高频运行而机器人面对行人和近距离障碍时恰恰需要毫秒级更新动作。若让一个 7B VLM 每一步都输出“左转、前进、右转”不仅延迟高轨迹还容易断断续续。《Ground Slow, Move Fast》提出DualVLN把导航明确拆成两个异步系统System 2 用 Qwen2.5-VL-7B 以约 2 Hz 做语义推理输出图像中的像素目标及其隐式语义表示System 1 用轻量 Diffusion TransformerDiT以约 30 Hz 读取新 RGB 画面把旧目标持续改写成 32 个平滑、可避障的轨迹点更下层的控制器再以 200 Hz 跟踪轨迹。这种设计在 R2R-CE Val-Unseen 上取得 64.3% 成功率相比此前的 StreamVLN 提升 7.4 个百分点在 RxR-CE 上取得 61.4%提升 8.5 个百分点。论文还构造了带动态人形智能体的 Social-VLN并把同一模型部署到 Turtlebot4、Unitree Go2 和 G1。不过实验也显示“能绕人”距离“懂社交”还有很远进入 Social-VLN 后DualVLN 的成功率从 64.3% 降到 37.2%人类碰撞率仍有 35.4%。猫先生认为DualVLN 最值得关注的不是把“快慢思考”这个比喻搬到机器人上而是给 VLM 与控制策略设计了一个更合适的接口大模型不必给出每一步动作只需给出可解释的中期方向小模型也不必重新理解整条指令只需在高频视觉反馈下把方向变成安全轨迹。这比单纯把 VLM 加速更接近真实机器人的系统约束。论文标题Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation论文地址https://arxiv.org/abs/2512.08186OpenReviewhttps://openreview.net/forum?idGK4rznYwhn项目主页https://internrobotics.github.io/internvla-n1-dualvln.github.io/GitHubhttps://github.com/InternRobotics/InternNav模型权重https://huggingface.co/InternRobotics/InternVLA-N1-DualVLN训练数据https://huggingface.co/datasets/InternRobotics/InternData-N1图 1System 2 以低频率完成像素目标定位System 1 高频生成连续轨迹并在动态行人场景中及时调整。来源原论文 Figure 1。原文脉络论文第 1 节从 VLM 导航的延迟、离散动作和动态避障困难切入。第 2 节回顾 VLN、视觉导航与机器人双系统。第 3 节是方法主体依次讲 System 2 的像素目标定位、显式与隐式目标接口以及 System 1 的异步扩散轨迹策略。第 4 节单独提出 Social-VLN第 5 节从连续仿真、物理仿真、真机跨本体和消融四个层面验证方法。第 6 节总结附录补充数据构造、训练参数和注意力可视化。1—2. 问题背景大模型的时钟跟不上机器人现有 VLM 导航大致有两条路线。一类把导航写成视觉问答让模型反复输出离散的前进、转向和停止动作另一类直接从 VLM 隐藏特征预测连续轨迹。前者容易解释也能继承语言模型的知识但动作短视且推理慢后者更接近端到端控制却把大模型推理与低层动作绑定在同一频率上。同步设计在静态基准里尚可工作进入真实环境后就会暴露问题。VLM 推理期间机器人、相机和行人仍在运动等动作到达时画面已经变了。若降低控制频率机器人会对突然出现的障碍反应迟钝若提高大模型调用频率算力和延迟又难以承受。DualVLN 的核心假设是语义决策和局部控制并不需要共享同一时钟。“穿过厨房后在沙发旁右转”这种全局判断可以慢一些而“前方有人、轨迹向左偏 20 厘米”必须快速更新。论文因此把前者交给 System 2把后者交给 System 1并通过像素目标和 VLM 隐藏表示连接二者。3. MethodGround SlowMove Fast图 2System 2 根据指令、历史图像和当前画面选择调整视角或输出二维目标System 1 融合目标、旧画面与最新画面生成连续轨迹。来源原论文 Figure 2。3.1 System 2先找到“最远可见目标”System 2 以 Qwen2.5-VL-7B 为基础输入语言指令、历史第一视角 RGB 和当前画面输出三类结果当前视角不合适时执行左转、右转、抬头或低头每次调整 15°路线可见时输出图像平面上的二维像素坐标判断抵达终点时输出STOP。训练像素目标时作者先把三维专家轨迹投影到当前相机画面再借助深度信息剔除被遮挡的点选择最远的可见轨迹点作为监督信号。这里的“最远”很关键若只预测眼前一步大模型仍会被迫频繁调用选择中期目标则能给 System 1 留出一段自主行动空间。二维投影并不总是成立。机器人面朝错误方向时未来路线根本不在视野内相机过高时地面目标也可能被遮挡。因此System 2 可以先主动环视或低头再输出坐标。附录进一步说明它一次最多可预测连续 4 个转向动作即最多调整 60°。System 2 先进行全参数微调视觉编码器和语言主干均解冻AdamW 学习率为 2×10⁻⁵批大小 128共训练 14000 步。显式坐标使高层决策可观察、可监督也能直接检查模型到底想往哪里走。3.2 为什么同时需要显式像素目标与隐式目标单个二维坐标太“薄”。同一个像素可能表示门洞中央、桌子旁的空隙或远处走廊但坐标本身不包含指令、历史画面、地标和可通行性等语义。若直接把坐标投影成三维点再交给传统 point-goal plannerVLM 与控制器仍是松散拼接。作者在 System 2 输出像素目标后追加 4 个可学习查询 token。它们读取包含指令、历史图像、视角调整、当前画面和像素坐标的完整上下文形成隐式 latent goal。第二阶段冻结 QwenVL只训练这 4 个查询和 System 1。于是两种接口各负其责显式像素目标回答“图像中往哪里走”便于监督、解释和跨场景泛化隐式目标表示携带“为什么往那里走、当前上下文是什么”给局部策略更丰富的条件。这是一种有意保留“中间瓶颈”的端到端学习接口不是完全手工也不是不可见的黑盒特征。3.3 System 1用新画面修正旧目标System 1 是一个紧凑的 flow-matching DiT一次生成 32 个等间隔轨迹点。视觉主干来自 Depth Anything V2-SmallDiT 的隐藏维度为 384包含 12 层、6 个注意力头。它的输入有两部分System 2 低频输出的 latent goal以及相机持续提供的高频 RGB。异步系统最难处理的是目标过期。假设 System 2 在时刻 t 根据一张画面给出目标System 1 到 tk 时已经向前走了一段若仍机械执行旧轨迹就无法估计已走距离也难以绕开刚出现的行人。为此System 1 同时编码 System 2 当时看到的旧帧和当前新帧用自注意力融合时间变化再通过 Q-Former 压缩为 32 个视觉 token作为 DiT 的高频条件。它并不等待 System 2 再次“想完”而是持续根据新画面重生成轨迹。System 2 约 2 Hz、System 1 约 30 Hz、控制器 200 Hz三层各自运行。第二阶段只使用像素目标样本训练离散专家动作被插值成 32 个平滑轨迹点。学习率为 1×10⁻⁴、批大小 128共 15000 步。数据缩放实验显示System 1 使用 1% 的轨迹已经有竞争力10% 左右接近饱和真正“吃数据”的仍是负责泛化的 VLM。猫先生认为这套架构最漂亮的地方是承认了异步带来的旧信息而不是假装两个模型总能拿到同一时刻的状态。旧帧—新帧配对让 System 1 学会解释“目标是在什么画面下提出的”相当于给高低层通信附带了时间上下文。4. Social-VLN会避开障碍不等于会与人共处图 3人形智能体从正面接近、在狭窄通道中相遇、多人同时出现或穿越路口等典型情形。来源原论文 Figure 3。标准 R2R-CE 和 RxR-CE 主要是静态室内环境难以评价机器人遇到行人后能否绕行并回到原任务。论文因此在 R2R-CE 与 Habitat 3.0 上构造 Social-VLN把一个或多个人形智能体放到真值路线附近同时人工检查路线没有被彻底封死并增加 Human Collision RateHCR指标。训练数据通过规则化专家采集。当人形分割掩码超过阈值时系统触发修改版 A* 重新规划避碰路线最终在 60 个 Matterport3D 场景中生成 76.3 万条 social navigation episode。图中的行为包括等待空隙、侧向让行、绕过多人后恢复原指令路线。图 4DualVLN 在 Social-VLN 仿真与真实行人场景中的局部轨迹变化。来源原论文 Figure 4。但量化结果比演示视频更值得看模型标准 R2R SRSocial-VLN SRSocial-VLN SPLHCRStreamVLN56.931.429.136.4DualVLN64.337.235.835.4DualVLN 在任务成功率上仍优于 StreamVLN但两者进入动态场景后都损失约 26—27 个百分点碰撞率也只相差 1 个百分点。这说明高频局部规划提高了恢复能力却还没有学会可靠的社交规范。Social-VLN 更准确的定位是“任务导向的动态人形避障基准”而不是完整的人机共处测试。5. Experiments泛化、真机与消融5.1 连续环境单目 RGB 下刷新结果在 VLN-CE 中DualVLN 只使用第一视角单目 RGB不依赖全景图、深度或里程计。关键结果如下模型R2R SRR2R SPLRxR SRRxR SPLRxR nDTWNaVILA54.049.049.344.058.8StreamVLN56.951.952.946.061.9DualVLN64.358.561.451.870.0在带物理运动控制器的 VLN-PE unseen split 上DualVLN 没有使用 VLN-PE 轨迹微调仍取得 51.60% SR 和 42.49% SPLNaVid 分别为 22.42% 和 18.58%。不过 DualVLN 的平均轨迹更长跌倒率和卡住率也高于 NaVid说明高成功率并不等价于更稳定的底盘执行。5.2 真机跨本体结果很强但不是完全板载 RGB-only图 5走廊、单卧室和 R2R 办公室中每个模型、每个场景进行 20 次测试。来源原论文 Figure 5 的 Success Rate 子图。作者把同一模型部署到轮式 Turtlebot4、四足 Unitree Go2 和人形 Unitree G1。DualVLN 在走廊、单卧室和复杂办公室中的成功率分别为 100%、95% 和 70%StreamVLN 分别为 100%、85% 和 60%。跨相机高度、震动和运动学本体保持了不错的零样本泛化。这里必须区分“模型观测”与“整套机器人系统”。完整模型运行在远程 RTX 4090 上占用约 20 GB 显存机器人通过 RealSense D455 上传同步 RGB-D服务器输出轨迹或视角动作再借助里程计转换到世界坐标并由 MPC 跟踪。System 2 使用 KV cache 后单次推理由 1.1 秒降到 0.7 秒System 1 通过 TensorRT 在 0.03 秒内完成 32 点轨迹生成。因此论文证明的是高层模型可依靠 RGB 完成语义导航以及双系统能接入多种机器人它还没有证明整套系统能够仅凭单目视觉、完全板载地闭环运行。每个场景 20 次测试也足以观察趋势但不足以覆盖真实公共空间的长尾风险。5.3 消融两个目标接口缺一不可图 6去掉顺序训练、像素目标上下文或可学习 latent goal 后R2R Val-Unseen 的 SR、SPL、OS 和 NE 均退化。来源原论文 Figure 7。把两个系统改为单阶段联合训练并取消显式中间像素目标SR 从 64.3% 降到 55.2%说明低层损失会拖慢扩散策略收敛也会损害 VLM 的泛化。第二阶段移除像素目标文本后SR 降到 62.2%不用可学习查询、直接读取像素目标的固定 VLM 隐藏状态SR 降到 60.9%。显式坐标和隐式语义并非重复信息。作者还把 System 1 换成具有 oracle depth 的 point-goal planner。R2R unseen 上iPlanner、NavDP 和 System 1 的 SR 分别为 47.07%、58.72% 和 63.62%。定性实验显示System 1 可以容忍目标点落在障碍附近只要大方向正确视觉反馈就能让轨迹绕开障碍但若像素目标方向或语义本身错了它同样会失败。6. Conclusion双系统解决了频率矛盾没有消除系统边界DualVLN 给 VLN 提供了一条很务实的工程路线让大 VLM 保留开放世界语义泛化把它的输出压缩为显式像素目标与隐式语义目标再让轻量策略负责高频、连续、动态的局部运动。它避免了用 7B 模型逐帧控制也避免了传统模块化导航在语义规划与局部执行之间的信息断层。论文仍留下四个清晰边界高层错误无法由低层完全补救。System 1 能修正小幅像素回归误差但不能修正错误地标或错误方向。动态避障尚未成为可靠的社会导航。35.4% HCR 和明显的成功率下降说明训练数据与评价指标仍需扩展。真机系统依赖外部基础设施。远程 4090、RGB-D、里程计和 MPC 都属于实际部署成本。2 Hz 与 30 Hz 是分层能力不是端到端无延迟。System 2 的真实推理仍约 0.7 秒异步机制主要是让机器人不必停下来等它。猫先生认为这篇论文对具身智能最有启发的结论是通用模型未必需要直接成为实时控制器。未来更可扩展的基础模型可能不是一个模型包办所有频率而是让语义推理、局部策略和底层控制通过可学习、可解释且带时间信息的接口协同。DualVLN 已经把这条路线走通了一大步下一步则是让接口对高层幻觉更鲁棒让局部策略真正理解人的意图并把整套系统压进机器人本体。推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列