尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

卓驭ZYT-World技术拆解:开环只能给分数,闭环才给教训

卓驭ZYT-World技术拆解:开环只能给分数,闭环才给教训 「开环只能给分数闭环才能学后果」目录01 研究背景开环只能给分数闭环才能学后果02 方法生成负责想象记忆负责认路1. 真实多目异构原生同时生成2. 有记忆行业首创的记忆回溯模块3. 可控交互三层变量干预​编辑4. 反应快推理长实时生成长程稳定不崩溃03 实现路径40步压到1步画质保持九成以上04 落地验证每次发版20万场景闭环用例05 总结端到端驾驶模型正越来越多地依赖世界模型生成数据—回炉训练的自进化闭环来提升能力。但这一闭环长期存在一个瓶颈世界模型能把画面渲染得足够真实却不会对驾驶模型的决定作出响应模型因此从未承担过自己动作的后果。近日卓驭科技首次解密其世界模型 ZYT-World。区别于行业普遍采用的开环仿真它面向闭环强化学习构建通过生成负责想象、记忆负责认路的组合使同一场景可被反复驶入并对决定作出真实响应让模型在平行世界中承担后果、积累分寸。该能力已进入卓驭量产模型的发版链路每次发版贡献超 20 万场景闭环用例。01 研究背景开环只能给分数闭环才能学后果理论上世界模型生成得越多驾驶模型的数据供给就越充分二者相互驱动、螺旋上升。然而这条闭环的真正瓶颈并不在画面的清晰度或真实度而在于世界不会因为模型的决定而改变。具体表现为两个层面的问题响应缺失合成场景中自车做出动作后世界仍按原有剧本推进。模型说我会打左却永远等不到打左之后的画面。训练停留在对人类驾驶动作的模仿而不是对自身决定的经验积累。不可重复即便世界能够自由生成同一路段重新驶入时往往被重新编造一遍。同一场景无法在只更换自车决定的前提下重来一次动作与后果之间的对应关系因此无法建立。其后果是模型学到的是别人的选择而非自己的教训。而最需要被反复体会的强交互工况——盲区窜出的电瓶车、恶意加塞、路口抢行——恰恰是真实路采中最难获得、也最不可能重复的部分。这两个问题恰好对应了现有两条技术路线各自的缺口重建路线NeRF、3D Gaussian Splatting 等忠实还原采集过的场景重新驶入同一路段时路牌与路边停放的车辆仍在原位——回得去但想不出。它只能复现已发生的事件无法生成若对向车抢行这类从未出现过的交互。生成路线视频世界模型能够外推未见过的场景——想得出却回不去。沿另一条轨迹重新驶入旧路段时多数情况下会重新编造一个路口。强化学习不给标准答案只给奖惩。它最依赖的资源不是算力而是环境。一个会对每个动作作出反应并允许同一件事重来一次的地方。只有在其余条件一致、仅更换自车决定的情况下两次结果的差异才等于这个决定本身的代价。02 方法生成负责想象记忆负责认路ZYT-World 的整体思路是不让世界模型自由发挥而是在生成能力之上插入一个记忆插件使推演既能外推长尾反事实场景又不会想过头。1. 真实多目异构原生同时生成实车的传感器不止一种布局既有视场角超 180° 的鱼眼也有针孔画幅从 5:1 到 5:4 五花八门。现有方案要么只采用一种相机配置要么将原生配置映射为标准镜头再生成结果是像但不像你车上那组眼睛。ZYT-World 原生同时生成量产 rig 上的所有视角鱼眼是鱼眼、针孔是针孔并严格对齐同一物理时刻前视里那辆白车侧鱼眼里也在该在的位置。每路约 720P2 张 GPU 跑到 4 帧/秒每帧只需 1 步去噪。2. 有记忆行业首创的记忆回溯模块当车辆沿另一条轨迹重新驶入去过的路段记忆模块会翻出历史观测把路牌、路边停着的车这些不该变的东西重现回来而不是随机再编一个、或者直接跳过。同一场景下两条独立轨迹的生成因此完全对齐这正是奖惩信号能与动作一一对应的前提。该模块为零初始化插件接入时对基座几乎无影响不接入时整层跳过其训练数据由端到端模型在真实场景生成替代轨迹并重建渲染已积累近百万对。3. 可控交互三层变量干预控自车同一起点掉头和刹停是两个世界控他车前车急刹、旁车加塞、电瓶车从盲区窜出控道路环境直路改岔路、绿灯提前变红。一次只动一个变量AI 司机哪里不行一测就知道。相机参数同样可控同一段乘用车数据换一套相机位置重新生成就成了商用重卡、物流车的视角数据。图注记忆回溯对比上为实车录像中为无记忆生成下为有记忆生成右侧红色是实车轨迹绿色是本次生成的目标轨迹。4. 反应快推理长实时生成长程稳定不崩溃强化学习要的是一个跑得动的环境。世界模型若一帧要等几秒rollout 就无从谈起。实时只要两张卡。每路约 720P 的多目异构画面一次同时生成每帧只需 1 步去噪2 张 GPU 跑到 4 帧/秒。支持分钟级连续输出。训练只见过 8 秒片段却能连贯跑 1 分钟以上不崩车道、建筑与光照效果维持稳定。至此闭环强化学习所需的四个前提世界看起来像你的车、回得去同一个地方、能被精确干预、还跑得动第一次同时成立。03 实现路径40步压到1步画质保持九成以上底座为逐帧自回归生成每步仅生成一个时刻的多视角画面写入 KV-cache 后推进下一步两路 Plücker adapter 分别编码鱼眼与针孔的射线几何自车运动、他车与车道布局逐帧注入。40 步压缩为 1 步由四个阶段完成阶段解决的问题因果化训练时仅允许看过去与部署一致一致性蒸馏将去噪切分为 48 个小台阶自回滚 w DMDstudent 连续推演 20 个时刻teacher 纠正累积漂移RigCritic处理鱼眼说左、针孔说右的跨相机失效叠加 19M 参数 TinyVAE、W8A8 低比特矩阵乘与硬件感知优化生成器比 40 步 teacher 快 107.7 倍解码器快 59.8 倍、显存省约 27 倍最终画质保持 teacher 的 90% 以上。有界 KV-cache 机制控制显存占用不随时间递增尽管训练数据仅覆盖 8 秒时序片段仍能完成分钟级连续 rollout车道、建筑与光照效果维持稳定。04 落地验证每次发版20万场景闭环用例ZYT-World 已落在卓驭三条技术线上往下为量产的原生多模态基础模型提供强化学习与仿真评测每次发版贡献超 20 万场景闭环用例往上作为实时训练场让模型在多模态环境中推演若换一种开法的结果往外凭借相机控制能力将已有数据拓展至商用重卡、物流车等多种构型平台。20 万闭环用例是其中信号最强的一项——它表明这些经历并非演示素材而是每次发版前模型实际经受的考验。需要说明的是目前公开的成果集中于世界模型侧的能力验证多目异构一致性、记忆回溯对齐、实时性与长程稳定性。至于经历这些场景之后量产模型在具体基准上的提升幅度尚无公开对照数据。这一环补齐后闭环的价值方能被完整量化。05 总结ZYT-World 的核心贡献在于重新定位了自进化闭环的瓶颈问题不在画面真实度而在世界能否对决定作出响应、并允许同一场景被重复经历。围绕这一判断卓驭以多目异构原生生成解决真实以行业首创的记忆回溯模块解决可重复以四阶段蒸馏与推理栈将 40 步压至 1 步解决实时使闭环强化学习第一次具备可用前提。现实不会给出第二次机会但经验的形成恰恰依赖重复。对于正在构建数据生成—回炉训练闭环的自动驾驶研究与工程团队而言把最昂贵、也最危险的那部分经历移入平行世界反复完成是一条颇具参考价值的技术路径。参考论文论文标题ZYT-World: A Real-Time Controllable World Model for Closed-Loop Autonomous-Driving Simulation论文链接https://arxiv.org/pdf/2609.21712
返回列表