
点击下方卡片关注「3D视觉工坊」公众号选择星标干货第一时间送达本文经作者授权发布 | 来源3D视觉工坊立体匹配(Stereo Matching)技术自诞生至今已有整整50年历史。近年来尽管深度学习算法在各大公开基准测试中屡创佳绩但它们往往高度依赖于在目标领域数据集上的微调(Fine-tuning)。为了解决这一痛点NVIDIA此前推出了FoundationStereo它不仅通过融合视觉基础模型(如DepthAnythingV2(的先验知识打破了合成数据与真实世界之间的鸿沟更实现了极强的零样本泛化能力(Zero-shot generalization)。然而作为大模型其计算成本极其高昂(在RTX 3090上单帧推理约需496ms)难以在机器人、自动驾驶等对延迟极度敏感的实时应用中落地。为了打破高泛化与高效率不可兼得的魔咒NVIDIA研究团队(Bowen Wen, Stan Birchfield等)重磅推出了全新架构——Fast-FoundationStereo。该模型在保持强大零样本泛化能力的同时首次在同类基础模型中实现了实时推理运行速度较原版提升10倍以上目前该论文已被CVPR 2026接收. 核心创新分而治之的极速加速策略现有的轻量化立体匹配模型通常需要从头设计并训练这不可避免地损失了网络容量且牺牲了对复杂非结构化环境的鲁棒性。相反Fast-FoundationStereo继承了大型教师模型(FoundationStereo)的强大能力针对立体匹配的三大核心步骤(特征提取、代价滤波、视差细化)提出了一套“分而治之”的加速策略1.混合单目与立体先验的特征蒸馏(Knowledge Distillation)原版模型使用DepthAnythingV2结合CNN提取特征极其消耗算力。本文提出通过知识蒸馏将教师模型中庞大的混合单目与立体先验特征直接压缩到一个高效的单一学生网络骨干中。实验表明即便经过大幅压缩学生模型依然能够敏锐地捕捉到相似的高频边缘和相对深度信息极大增强了模型对半透明等复杂材质的鲁棒性。2.代价滤波的高效分块架构搜索(Blockwise Architecture Search)3D代价体滤波(Cost Filtering)是立体匹配的计算瓶颈。由于代价体通道数较少直接剪枝会导致精度灾难性下降。研究人员没有选择费时费力的传统全局网络架构搜索(NAS)而是创造性地将网络划分为多个局部Block进行分块独立蒸馏。 随后团队利用整数线性规划(ILP)在极短的时间内完成了在给定延迟预算下对数以亿计()的网络结构组合进行优选。这种方法将搜索复杂度从指数级降至线性级大幅降低了计算成本。3.迭代细化的结构化剪枝(Structured Pruning)在视差的迭代细化阶段(基于ConvGRU)为了消除网络冗余研究人员针对其独有的循环特性构建了带有循环约束的依赖关系图。通过一阶泰勒展开评估参数重要性并进行结构化剪枝随后微调网络以恢复精度这使得模型可直接受益于TensorRT等硬件加速库。4.互联网级真实数据伪标签 (Internet-Scale Pseudo-Labeling)为了补充合成数据的不足并进一步提升蒸馏效果研究团队利用互联网上庞大的真实立体视频(Stereo4D数据集)建立了一套自动化的数据清洗流水线。该流水线通过交叉验证教师模型的双目视差预测与单目深度预测生成一致性掩码最终提炼出140万对高质量的“野外(In-the-wild)”真实图像伪标签极大地增强了模型在各种真实场景中的泛化能力。 实验结果零样本泛化横扫多榜单在实验验证中研究人员将Fast-FoundationStereo与各种主流模型包括实时模型与非实时大模型在未见过的数据集(Middlebury, ETH3D, KITTI, Booster)上进行了零样本泛化测试(Zero-Shot Generalization)。1.绝对碾压的实时SOTA在与其他实时立体匹配方法(如 RT-IGEV, LightStereo-L, BANet3D等)的较量中Fast-FoundationStereo 在所有基准测试中均展现出断崖式的领先优势。2.比肩重量级大模型尽管推理速度极快Fast-FoundationStereo 的预测精度仍可与目前计算最为密集的顶级泛化模型(如StereoAnywhere, Zero-RAFT-Stereo)相媲美。3.应对高难度材质与场景得益于蒸馏出的视觉先验知识模型在处理透明玻璃、弱纹理墙面、镜面反光及强曝光场景时依然能够输出极其平滑和锐利的深度图。4.极致加速体验在同一块NVIDIA 3090显卡上原版基础模型的耗时高达 496ms(约2 FPS)而 Fast-FoundationStereo 的耗时骤降至 49ms(经过TensorRT进一步优化可达21ms即~47 FPS)完美适配实际部署需求。总结基础视觉大模型在三维视觉领域展现出了惊人的潜力但落地的最后一公里往往受制于算力瓶颈。NVIDIA Fast-FoundationStereo采用分而治之的策略结合蒸馏、NAS架构搜索、结构化剪枝与自动化真实数据伪标签生成技术成功搭建了首个能在实时帧率下运行且具备顶级零样本泛化能力的立体匹配基础模型。这一突破为机器人导航、自动驾驶和空间计算等需要实时 3D 感知的应用铺平了道路。•论文:https://arxiv.org/abs/2512.11130•项目网页:https://nvlabs.github.io/Fast-FoundationStereo/•代码、模型与数据集:https://github.com/NVlabs/Fast-FoundationStereo 团队介绍本文作者为来自美国英伟达的团队Bowen Wen、Shaurya Dewan、Stan Birchfiel其中一作Bowen Wen(温伯文)在英伟达研究院担任主任研究科学家从事3D视觉感知和具身智能大模型的研究。此前曾任职于谷歌X、Meta Reality Labs、Amazon Lab126。 他曾荣获CVPR和RSS最佳论文奖提名近期的代表作有FoundationPose、FoundationStereo、BundleSDF、MimicGen等多篇热门开源工作。本文仅做学术分享如有侵权请联系删文。3D视觉方向论文辅导来啦可辅导SCI期刊、CCF会议、本硕博毕设、核心期刊等。添加微信cv3d001备注姓名方向单位邀请入群。