尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

NAVSIM双榜SOTA!LaST-VLA:用潜在时空CoT重构VLA推理(清华小米)

NAVSIM双榜SOTA!LaST-VLA:用潜在时空CoT重构VLA推理(清华小米) 点击下方卡片关注“自动驾驶之心”公众号戳我-领取自动驾驶近30个方向学习路线作者 | Yuechen Luo等编辑 | 自动驾驶之心本文只做学术分享如有侵权联系删文自动驾驶前沿信息获取→自动驾驶之心知识星球虽然视觉-语言-动作VLA模型通过统一感知和规划彻底改变了自动驾驶但它们对显式文本思维链CoT的依赖导致了语义-感知解耦和感知-符号冲突 。最近向隐式潜在推理的转变试图通过在连续的隐藏空间中思考来绕过这些瓶颈 。然而如果没有显式的中间约束标准的隐式 CoT 通常会表现为一种与物理规律无关的表示形式。为了解决这个问题清华联合小米等研究团队提出了“隐式时空 VLA”LaST-VLA这是一个将推理范式从离散符号处理转变为具有物理基础的隐式时空 CoT 的全新框架 。通过实现双特征对齐机制我们将 3D 基础模型的几何约束和世界模型的动态预见能力直接提取蒸馏到隐式空间中 。该方法结合了从特征对齐过渡到轨迹生成的渐进式监督微调SFT训练策略并通过带有组相对策略优化GRPO的强化学习进行改进以确保驾驶的安全性和规则合规性。LaST-VLA 在 NAVSIM v191.3 PDMS和 NAVSIM v287.1 EPDMS上创造了新纪录同时在 SURDS 和 NuDynamics 基准测试的时空推理中也表现出色。论文标题LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving论文链接https://arxiv.org/pdf/2603.01928项目主页https://github.com/luo-yc17/LaST-VLA当前问题当前最先进的视觉-语言-动作模型已经能够理解“左转”、“避让行人”这样的复杂指令。但它们实现“理解”的方式却存在两大硬伤显式文本链的“幻觉”与解耦为了让推理过程可解释许多模型会生成类似人类“内心独白”的文本链如“我看到前方有车所以减速”。但将密集、连续的视觉信息强行压缩成离散的文字会产生语义鸿沟。模型可能“脑补”出与画面不符的文本导致规划器忽视真实视觉证据遵循有缺陷的“语言指导”酿成危险决策。隐式推理的“无根”与不稳定为了绕过文本瓶颈近期研究转向在连续的隐空间中进行推理。这虽然高效但缺乏中间监督。就像一个学生只被告知最终答案却不知道解题步骤训练过程极不稳定模型容易“学歪”生成与物理现实无关的表示。问题的根源在于推理过程与物理世界脱节了。无论是离散的符号还是无监督的连续向量都没有被“锚定”在真实的3D几何和时空动态中。因此如何让VLA模型具备3D/WM能力同时直接作用到后面的Answer上去。3 方法LaST-VLA通过隐式时空链式推理Latent Spatio-Temporal CoT将推理过程从离散符号处理转移到物理约束的连续隐空间结合几何先验和动态先验提升规划稳定性与准确性。3.1问题建模 (Preliminaries)输入定义在任意时间步系统接收多模态查询。其中是前视摄像头图像包含文本导航指令、自车状态速度、加速度以及历史轨迹 。 创新点 1隐式推理与概率解耦有别于传统 VLA 模型直接将输入映射为动作LaST-VLA 引入了连续的隐式状态作为推理桥梁 。模型将隐式特征严格解耦为动态特征捕捉时间动态演变和几何特征编码空间几何 。模型的联合分布被优雅地解耦为“思考Thinking”和“规划Planning”两个阶段 在这个自回归过程中模型首先作为“思考者”生成连续的推理状态然后作为“规划者”在这些物理先验的条件下预测轨迹路点。3.2 隐式时空思维链 (Latent Spatio-Temporal CoT) 创新点 2特征级知识蒸馏摒弃像素级重建传统方法通常依赖密集的像素级重建如预测深度图或未来视频帧来学习物理规律这会带来巨大的计算开销并引入大量无关的纹理细节 。LaST-VLA 创新性地引入了外部基础模型作为特征级教师直接在隐式特征空间中对齐几何和动态先验 。具体流程视觉编码与掩码视觉编码器提取图像特征并与文本特征拼接 。VLM 自回归生成隐式状态序列。为了防止模型在对齐时走捷径只看原始像素而不进行推理在训练时对视觉特征应用随机掩码得到。动态适配器 ()将序列隐藏状态与视频世界模型Cosmos的表示空间对齐从而捕捉交通参与者的未来运动先验 。几何适配器 ()将空间隐藏状态与 3D 基础模型VGGT的密集特征空间对齐在隐式空间中恢复场景深度和占用结构等空间先验 。对齐转换过程公式化为 最后规划器在这些物理特征的条件下生成未来轨迹 3.3 渐进式两阶段监督微调 (Progressive Two-Stage SFT) 创新点 3结构化因果掩码与渐进式学习为了让模型真正内化物理规律作者将训练解耦为“学习思考”和“学习行动”两个阶段并通过巧妙的掩码机制强制模型进行高层语义推理 。统一优化目标 特征对齐损失采用均方误差 (MSE) SFT 总损失为动作交叉熵损失与对齐损失的加权和 第一阶段物理感知对齐 (Phase I)侧重于学习物理知识。设置。引入结构化因果掩码1) 隐式相互掩码3D 和 WM token 互不可见独立学习2) 视觉瓶颈掩码动作 token 无法看到原始图像特征 。这强制模型将所有必要的视觉信息压缩到隐式 CoT 中使其成为决策的唯一信息桥梁 。第二阶段基于隐式特征的规划 (Phase II)侧重于精炼驾驶策略。反转权重。移除掩码允许动作 token 同时关注隐式 CoT 和原始图像细节以实现稳健驾驶 。3.4 基于 GRPO 的隐式基础轨迹优化 (Trajectory Refinement via GRPO) 创新点 4稳定先验下的强化学习安全护栏在 SFT 赋予模型时空理解能力后框架冻结了动态和几何适配器保证物理规律的稳定性并使用组相对策略优化GRPO来最大化轨迹级奖励直接针对驾驶安全性和合规性进行优化 。奖励设计包含三个部分 PDMS 奖励 ()评估预测轨迹的整体质量碰撞、合规等 。格式奖励 ()对未能遵守所需输出格式的行为进行严格惩罚 。目标奖励 ()基于终点预测的准确度给予阶梯式奖励 。总奖励公式为 GRPO 优化目标 利用相对优势Advantage更新策略并加入 KL 散度防止模型过度偏离参考策略 其中为标准化后的优势函数 。4. 实验结果4.1 主实验在Navsimv1与Navsimv2上LaST-VLA-2B与LaST-VLA-8B均能实现很好的效果。LaST-VLA-8B达到91.3 PDMS超越之前最佳纯视觉方法0.5分。轻量化的2B版本达到91.1 PDMS以更少的参数实现了优于之前2B模型Recogdrive-2B的性能。安全性指标显著提升NC与DAC的高分验证了几何隐式思考带来的精确空间感知TTC的高分则验证了动态隐式思考带来的前瞻预测能力。在RL阶段我们仅使用Navsim v1的PDMS作为Reward Model同样在Navsim v2的EPDMS上实现了最佳的性能证明LaST-VLA不是仅仅只能拟合PDMS还能够在EPDMS表现很好。4.2 消融实验整体优势仅仅通过监督微调SFTLaST-VLA的 8B 和 2B 版本就稳定超越了它们对应的 InternVL3 基线模型 。空间与几何推理SURDS 基准8B 模型的总分相比 SURDS-3B 方法和基线模型分别大幅提升了 43.49% 和 7.68%2B 模型也提升了 8.17% 。绝对定位在偏航角确定和像素估计任务上准确率均超过 70%展现了极强的内在几何推理能力 。相对关系在判断左右90.27%和前后88.00%等空间关系任务上表现极为优异这证明了其强大的空间组合推理能力有效缓解了以往 VLM视觉语言模型中常见的空间迷失问题 。动态场景理解NuDynamics benchmark8B 和 2B 模型的运动得分Motion scores分别达到了 81.19% 和 71.80% 。这一成绩不仅超越了微调后的基线模型甚至击败了参数量巨大的通用大模型 Qwen2.5-VL-72B 。文本 CoT 存在语义局限引入显式的文本 CoT 虽能带来性能增益1.2 PDMS并辅助任务分解但其上限受制于文本与视觉之间的语义鸿沟 。无监督隐式 CoT 陷入“黑箱”困境虽然无监督的隐式 CoT 成功绕过了文本瓶颈达到 89.8 PDMS但因缺乏物理约束导致训练过程极不稳定即使在训练后期也会出现剧烈的性能波动 。物理监督隐式 CoT 兼顾性能与稳定对隐式特征施加显式的物理监督达到了最佳表现比无监督版本高出 1.5 PDMS不仅性能最优而且在模型收敛时极其稳健 。物理先验直接转化为行驶安全这种物理约束切实带来了关键的安全提升将 DAC 提升至 97.9TTC 提升至 95.6 。这证明了将隐式 CoT 与物理先验对齐能成功把不稳定的特征转化为一个强大且有依据的推理引擎 。自动驾驶之心求点赞求分享求喜欢
返回列表