RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models无痛推进实时目标检测

发布时间:2026/7/26 13:56:38

RT-DETRv4: Painlessly Furthering Real-Time Object Detection with Vision Foundation Models无痛推进实时目标检测 RT-DETR系列目前迭代至v4版本前面系列博文如下感兴趣的话可以自行移步阅读v1《DETRs Beat YOLOs on Real-time Object Detection——DETRs在实时目标检测中超越YOLO》v2《RT-DETRv2: Improved Baseline with Bag-of-Freebies for Real-Time Detection Transformer——基于免费午餐套件的改进基线》v3《RT-DETRv3: Real-time End-to-End Object Detection with Hierarchical Dense Positive Supervision》这里是v4这篇文章的主要研究内容可以概括为以下几点1.研究背景与动机实时目标检测在计算机视觉中具有重要意义尤其是在自动驾驶、人机交互等需要快速决策的应用中。现有的轻量级检测器如YOLO系列和DETR系列虽然在速度上取得了显著进展但往往以牺牲特征表示能力为代价导致性能提升遇到瓶颈。视觉基础模型VFMs如DINOv3能够学习到丰富的语义表示但直接应用于实时检测器会增加推理开销限制其实际部署。2.研究目标提出一种高效且适应性强的知识蒸馏框架利用VFMs的强大语义表示能力来增强轻量级目标检测器的性能。在不增加推理和部署开销的前提下实现显著的性能提升弥合轻量级检测器与高性能模型之间的差距。3.主要贡献提出了一种成本效益高且适应性强的语义蒸馏框架利用VFMs的语义表示能力通过训练阶段的知识迁移增强轻量级检测器的特征表示。提供了一种可扩展的途径将基础模型的高级语义转移到轻量级架构中。设计了深度语义注入器DSI和梯度引导的自适应调制GAMDSI通过将VFMs的高级语义注入检测器的深层特征图特别是F5显著提升特征表示能力。GAM根据梯度范数动态调整语义注入的强度确保训练过程中的稳定性和优化平衡。建立了新的模型系列RT-DETRv4在COCO数据集上达到了49.7/53.5/55.4/57.0的AP分数速度分别为273/169/124/78 FPS刷新了实时目标检测的最新记录。4.研究方法深度语义注入器DSI将VFMs的高级语义表示与检测器的特征图对齐通过特征投影器解决空间分辨率和通道维度的差异。采用余弦相似性损失函数最大化检测器特征与教师特征之间的相似性提升语义对齐效果。梯度引导的自适应调制GAM根据梯度范数比例动态调整语义注入损失的权重避免固定权重带来的优化问题。通过动态调整确保检测任务和语义监督之间的平衡提升模型的收敛速度和稳定性。5.实验结果在COCO数据集上RT-DETRv4在多个模型尺度上均实现了显著的性能提升超越了现有的YOLO系列和DETR系列检测器。与现有方法相比RT-DETRv4不仅在精度上取得了突破而且在推理速度上保持了优势证明了其在实际应用中的潜力。6.结论通过明确的语义监督该研究成功地将大规模基础模型的语义表示能力转移到轻量级检测器中为实时目标检测提供了一种高效且实用的解决方案。这种方法不仅提升了检测器的性能还保持了对部署环境的友好性为未来实时视觉任务的发展提供了新的方向。总体而言这篇文章的核心在于通过知识蒸馏技术将视觉基础模型的强大语义表示能力与轻量级检测器相结合实现了高性能与低开销的平衡为实时目标检测领域带来了新的突破。这里是自己的论文阅读记录感兴趣的话可以参考一下如果需要阅读原文的话可以看这里如下所示摘要实时目标检测通过精心设计的架构和优化策略取得了显著进展。然而通过轻量级网络设计追求高速推理往往会导致特征表示能力下降这阻碍了性能的进一步提升和实际的设备端部署。在本文中我们提出了一种成本效益高且高度适应性强的知识蒸馏框架利用快速发展的视觉基础模型VFMs的能力来增强轻量级目标检测器。鉴于VFMs与资源受限检测器之间在架构和学习目标上存在显著差异实现稳定且与任务对齐的语义转移是具有挑战性的。为此我们一方面引入了一个深度语义注入器Deep Semantic Injector, DSI模块促进VFMs的高级表示与检测器深层的融合另一方面我们设计了一种梯度引导的自适应调制Gradient-guided Adaptive Modulation, GAM策略根据梯度范数比例动态调整语义转移的强度。在不增加部署和推理开销的情况下我们的方法在多种基于DETR的模型上实现了显著且一致的性能提升突出了其在实时检测中的实用性。我们的新模型系列RT-DETRv4在COCO数据集上达到了49.7/53.5/55.4/57.0的AP分数对应的速度分别为273/169/124/78 FPS刷新了COCO数据集上的最新记录。1. 引言实时目标检测是计算机视觉中的一个基础任务支撑着许多需要即时感知和决策的交互式和安全关键型应用例如自动驾驶[5]、具身智能[21]和人机交互[16]。在过去十年中这一领域的发展主要得益于日益高效的网络架构和端到端学习框架。特别是YOLO[30]和DETR[3]这两个代表性系列深刻影响了目标检测范式的发展。YOLO系列强调快速的单阶段检测实现了高推理速度和实际部署效率DETR系列则通过其统一的对象查询和基于集合的预测重塑了检测范式。其中RT-DETR[38]作为第一个实时DETR标志着DETR家族进入实时领域其在速度和性能上均超越了YOLO模型。尽管取得了显著进展但一个长期存在的挑战依然存在设计轻量级模型以实现高推理速度与采用复杂架构以提升特征表示能力之间的固有折衷。为了满足实时约束检测器通常采用轻量级主干网络和精心设计的计算模块这不可避免地削弱了其捕捉高级语义的能力导致了语义瓶颈。这一限制不仅阻碍了性能的进一步提升也增加了实际设备端部署的难度。在本文中受视觉基础模型VFMs[13,31]快速发展的启发我们提出了一个成本效益高且高度适应性强的知识蒸馏框架利用VFMs的强大表示能力来增强轻量级目标检测器。通过在训练期间将VFMs的丰富语义转移到实时检测器中同时在推理期间保持检测器架构不变我们的方法在不引入任何额外推理或部署成本的情况下实现了显著的增强。这一优势对于实际的实时检测应用尤为重要。然而由于VFMs和资源受限检测器在架构和学习目标上存在较大差异实现稳定且与任务对齐的语义转移是具有挑战性的。为了解决这一问题我们首先引入了一个深度语义注入器DSI模块使VFMs的高级表示能够与检测器的深层进行融合。为了确保稳定高效的优化我们进一步设计了一种梯度引导的自适应调制GAM策略根据梯度范数比例动态调整语义注入的强度从而协调语义转移和检测目标的学习。广泛的实验表明我们提出的框架在不增加推理或部署开销的情况下实现了对先进DETR基础检测器的一致且显著的性能提升突出了其有效性。总结来说我们的主要贡献如下我们提出了一个成本效益高且高度适应性强的知识蒸馏框架利用VFMs不断发展的能力无痛增强实时检测器为将基础模型级别的语义转移到轻量级架构提供了一个可扩展的途径。我们提出了深度语义注入器DSI和梯度引导的自适应调制GAM它们能够在架构和学习目标差异显著的VFMs和检测器之间实现稳定且与任务对齐的语义转移。我们建立了一个新的模型系列RT-DETRv4-S/M/L/X在COCO[20]上分别达到了49.7/53.5/55.4/57.0的AP分数速度分别为273/169/124/78 FPS刷新了COCO数据集上的最新记录。2. 相关工作2.1 实时目标检测实时目标检测的发展长期以来一直受到YOLO系列[30]的推动该系列通过高效的单阶段检测流程普及了这一范式。在过去几年中这一系列经历了快速的迭代引入了主干网络设计、标签分配、优化策略等方面的持续改进[2,9,10,18,28,29,34,35]。最近的几代产品进一步扩展了设计空间YOLOv10[33]消除了YOLO系列长期以来依赖的非极大值抑制NMSYOLO11[11]改进了架构层次和颈部连接YOLOv12[32]引入了注意力机制以更好地进行上下文推理YOLOv13[17]探索了超图表示以捕获更高阶的特征依赖。这些进展推动了卷积和混合架构的性能-效率边界逐渐缩小了实时检测器和高精度检测器之间的差距。与此同时另一条研究线路围绕DEtection TRansformerDETR[3]展开该方法将目标检测重新定义为一个集合预测问题并消除了手工设计的组件如锚点设计和NMS。这种基于Transformer的范式启发了许多变体包括Deformable DETR[39]、Conditional DETR[24]和DAB-DETR[22]它们专注于提高收敛速度和定位精度。后续的研究如DNDETR[19]、DINO[37]和Group-DETR[6]引入了去噪目标和分组监督以进一步增强训练稳定性和表示质量。在此基础上RT-DETR[38]建立了第一个实时端到端Transformer检测器其在速度和性能上与当代YOLO模型相当甚至在某些情况下超越了它们。后续的研究继续在不增加推理开销的情况下提高其训练效率和表示学习。例如RTDETRv2[23]和RT-DETRv3[36]引入了辅助监督以增强梯度流动D-FINE[26]采用自蒸馏来细化语义表示DEIM[15]引入了密集匹配以实现更精确的特征对齐。这些研究表明了一个明确的趋势随着架构效率的饱和训练监督和语义表示成为进一步发展的主要杠杆。我们的工作基于这一见解通过深度语义转移增强核心表示在不增加部署或推理成本的情况下实现更高的精度。2.2 视觉基础模型视觉基础模型VFMs已成为从大规模图像语料库中学习通用视觉表示的主导范式这些语料库几乎不需要或不需要人工监督。早期的进展源于自监督和弱监督学习方法这些方法使模型能够从未标记或松散标记的数据中捕获高级语义。代表性方法包括对比学习框架如SimCLR[7]和MoCo[12]这些框架通过在相同图像的增强视图之间强制一致性同时与其他图像进行对比学习区分性特征。CLIP[27]进一步扩展了这一思想进行了大规模的图像-文本对比训练对齐视觉和语言嵌入并展示了在多样化任务中的强大零样本迁移能力。受自然语言处理中掩码语言建模的启发掩码图像建模MIM方法被引入以重建被掩码的图像区域从而学习上下文感知和整体表示。值得注意的方法包括MAE[13]和BEiT[1]。在此基础上DINO系列[4,25,31]整合了对比、基于重建和自蒸馏目标以产生高度语义化和可迁移的特征。特别是DINOv3[31]展示了大规模自监督学习的可扩展性和有效性在没有人工注释的情况下实现了丰富且鲁棒的表示。3. 方法3.1 概述在本工作中我们将框架应用于基于DETR的实时目标检测器即RT-DETR模型[38]。我们方法的整体框架如图2所示其中提出的模块以蓝色突出显示。预备知识。我们的模型基于RT-DETR架构特别是其高效的混合编码器如整体框架所示。编码器处理从CNN主干网络提取的多尺度特征图S3, S4, S5。它由两个主要部分组成基于注意力的同尺度特征交互AIFI为了保持计算效率仅对最高级特征图S5∈RH/32×W/32×C5应用自注意力。AIFI捕获全局上下文和长距离依赖生成增强表示F5。基于CNN的跨尺度特征融合CCFF语义丰富的F5进一步与低级特征图S3和S4融合将高级语义传播到浅层特征中生成最终的多尺度输出P3, P4, P5供解码器使用。动机。混合编码器的设计使得特征图F5的质量尤为重要。作为唯一经过自注意力处理的特征图F5是整个模型中高级、全局语义信息的主要来源。其质量直接影响CCFF模块中的跨尺度融合、初始查询选择以及最终解码器的性能。这种依赖关系导致了我们所说的F5语义瓶颈。然而生成F5的AIFI模块仅接受间接监督因为来自最终检测损失的梯度必须通过解码器和CCFF反向传播才能到达F5。这种间接监督可能不足以完全优化F5。为了解决这一问题我们提出了深度语义注入器DSI这是一个轻量级的仅训练模块明确地将F5与来自视觉基础模型的语义丰富表示对齐。这种针对性的监督增强了F5的语义表达能力并允许其梯度通过AIFI和主干网络反向传播协同提升这两个模块。在引入DSI后总训练目标定义为然而由于VFMs和资源受限检测器在架构和学习目标上存在较大差异实现稳定且与任务对齐的语义转移是具有挑战性的。不恰当的λ选择可能在训练初期提供不足的语义监督或在后期过度主导检测目标最终阻碍收敛并降低性能。为了适应训练过程中不断变化的优化动态我们提出了梯度引导的自适应调制GAM一种根据梯度统计动态调整λ的机制确保检测和语义监督之间的平衡优化。3.2 深度语义注入器语义注入。如图3所示我们设计了三种逐步增强的语义注入配置。在配置a和b中DSI模块通过特征投影器在不同层次深度进行特征对齐将冻结的VFM中的语义知识注入到检测器的特征层次中。在配置c中考虑到AIFI模块在混合编码器中的关键作用对齐在其输出F5上进行F5包含最丰富的语义。不分离梯度DSI损失允许反向传播从而更新轻量级主干网络。因此正向传播利用增强的F5指导CCFF模块中的跨尺度融合而反向传播强制语义一致性并增强主干网络的表示能力。这种双向监督实现了检测器的统一语义增强。3.3 梯度引导的自适应调制为了确保稳定且自适应的语义监督我们提出了动态梯度引导的自适应调制GAM机制该机制根据其梯度范数比例而非原始损失幅度调节AIFI模块的相对贡献。这种基于梯度的调节自适应地将AIFI的有效贡献保持在期望范围内从而实现模型各部分之间的平衡优化。具体来说对于每个训练步骤t在第e个epoch内我们计算每个主要组件的L1​范数梯度包括主干网络、AIFI、CCFF和解码器这一更新规则推动AIFI的有效梯度贡献收敛到期望的操作范围内同时防止振荡。超参数ρ和δ提供了对训练动态的明确控制ρ定义了期望的监督强度而δ调节响应性与稳定性的权衡。较小的δ可以实现更快的适应但可能带来不稳定性而较大的δ则会带来更平滑但更慢的收敛。在实践中GAM提供了稳定的收敛并且一致地改善了语义对齐而无需额外的调整开销。4. 实验4.1 实验设置数据集和评估指标。所有实验均在COCO 2017[20]数据集上进行使用train2017分割进行训练val2017用于评估。我们报告标准的COCO指标包括AP在0.50-0.95之间均匀采样的IoU阈值步长为0.05AP50AP75以及不同尺度下的APAPSAPMAPL。实现细节。我们的实验基于RT-DETR架构[38]并引入了RT-DETRv2[23]、DFINE[26]和DEIM[15]中的架构和训练改进。为了公平比较核心超参数与相应基线保持一致。DSI使用预训练且冻结的DINOv3-ViT-B模型作为语义教师。所有评估均使用COCO AP指标进行并在单个NVIDIA T4 GPU上以TensorRT FP16精度测量推理延迟以毫秒为单位。4.2 与最新技术的比较我们将提出的RT-DETRv4与最近的实时检测器进行了比较包括最新的YOLO系列YOLOv10[33]、YOLOv11[11]、YOLOv12[32]和YOLOv13[17]和基于DETR的检测器RTDETR[38]、RT-DETRv2[23]、RT-DETRv3[36]、DFINE[26]、DEIM[15]和DEIMv2[14]。结果如图1所示详细统计数据如表1所示。结果表明RT-DETRv4在所有模型尺度上均实现了最佳性能。具体来说我们的RT-DETRv4-L在COCO上达到了55.4 AP速度为124 FPS优于YOLOv13-L53.4 AP和DEIM-L54.7 AP在相同或更低的计算预算下。最大的变体RT-DETRv4-X达到了57.0 AP超过了DEIM-X56.5 AP且没有引入任何推理开销。在较小的尺度上RT-DETRv4-S和RT-DETRv4-M分别获得了49.7和53.5 AP均明显超过了它们的DEIM对应物49.0和52.7 AP。为了确保在相似的延迟范围内进行公平比较我们仅在图1中报告DEIMv2[14]的结果并将其从表1中排除因为它们的模型通常表现出更高的推理延迟。在相当的推理速度下我们的RT-DETRv4-M超过了DEIMv2-S53.5 AP vs. 50.9 AP169 FPS vs. 173 FPSRT-DETRv4-L进一步优于DEIMv2-M55.4 AP vs. 53.0 AP124 FPS vs. 113 FPS。这些结果充分证明了我们提出方法的有效性和巨大潜力。尽管DEIMv2-X实现了更强的性能但其延迟也高于RT-DETRv4-X。此外直接采用DINOv3作为主干网络以获得语义丰富性从根本上受到模型大小和部署成本的限制限制其仅适用于DINOv3的Tiny或Small变体并且难以扩展到更强大的大规模模型。相比之下我们的框架对VFM的类型和规模均保持不可知性不引入任何推理或部署开销提供了一个更灵活且部署友好的解决方案。4.3 消融研究我们进行了一系列消融实验以验证所提模块的有效性。除非另有说明所有消融实验均训练了36个epoch。未指定的超参数或配置遵循相应实验设置的最佳配置。DSI和GAM的消融我们首先评估了DSI和GAM的有效性。如表2所示仅应用DSI可以带来轻微的性能提升而进一步应用GAM可以显著提升性能0.5 AP这充分证明了两者的有效性。为了验证我们方法的通用性我们还在RT-DETRv2和D-FINE上进行了实验结果表明我们的方法可以为不同的检测器带来一致的性能提升。语义注入位置的消融为了验证注入位置的选择我们将图3中所示的策略进行了比较。表3中的结果表明分别或联合对主干特征S3, S4或S5应用语义监督均未带来提升。同样对齐主干和F5特征的混合方法策略b也未提供任何增益53.8 AP。相比之下我们的设计策略c仅对齐AIFI输出F5​实现了明确的0.5 AP提升54.3 AP。这表明在F5​中保持丰富的语义对于增强检测性能至关重要因为它在传播高级语义信息到后续特征层次中发挥着关键作用。此外混合方法的无效性表明同时对齐基于CNN的主干特征和基于Transformer的AIFI特征可能会引入优化冲突或语义错位。我们的选择不仅更有效而且更高效。它避免了多次中间投影和插值的复杂性且来自单一F5对齐损失的梯度自然地反向传播以协同更新AIFI和主干网络以单一、针对性的目标实现一致的增强。特征投影器的设计特征投影器是连接学生和教师特征空间的关键组件。我们在表4中探索了几种架构选择。基于线性的投影器获得了最佳结果在表达能力和参数效率之间达到了最佳平衡。损失函数的选择我们进一步研究了DSI的对齐损失。我们在表5中比较了均方误差MSE损失和余弦相似性损失后者优于前者验证了我们关于对齐特征方向更为重要的假设。GAM与静态权重的比较最后我们验证了所提出的GAM与静态权重的比较。GAM在导航训练动态方面的优越性进一步在图5中展示该图绘制了随epoch变化的验证AP。如图所示GAM的曲线始终高于基线和所有静态权重配置展示了其在整个训练过程中提供稳定且有效的监督能力。表6详细列出了静态权重和GAM的结果。对于静态权重在λ20时性能达到峰值达到55.1 AP但随着值的减小或增大性能会下降。然而观察图5中的训练曲线我们发现即使是这个最佳静态权重λ20也会导致早期到中期收敛速度变慢突出了固定超参数的固有限制。我们的实验表明GAM实现了最佳性能55.4 AP。特征可视化图4在视觉上比较了DEIM-L和我们的RT-DETRv4-L之间的特征图。值得注意的是我们的模型丰富了AIFI特征F5的语义内容导致后续多尺度特征P3、P4和P5中的目标轮廓和背景更加精确且可区分。特别是P5对目标区域的响应更强且更集中。5. 讨论为了进一步突出我们的框架相对于现有方法[14,26]的优势我们从三个角度进行讨论部署效率、可扩展性和训练效率。部署效率我们的方法对检测器架构不作任何修改也不改变推理流程确保不会引入任何额外的计算成本或延迟。这种对部署友好的特性对于工业应用至关重要在工业应用中实时检测器紧密集成到现有系统和硬件受限环境中。可扩展性该框架高度通用可以无缝应用于具有不同架构的检测器包括基于CNN和基于Transformer的检测器。它使所有类型的实时检测器都能快速受益于视觉基础模型VFMs的快速发展。此外该框架不受限于任何特定类型或规模的VFM。它可以灵活地整合不同的基础模型如DINOv3[31]、MAE[13]或CLIP[27]甚至可以从任意大规模模型中提取语义以注入实时检测器。这种灵活性还为多VFM语义整合开辟了有希望的方向进一步证明了框架的通用性和适应性。训练效率我们的方法轻量级且易于实现。由于在整合VFMs时既不修改检测器结构也不修改优化流程因此额外的训练成本保持在最低限度。这种效率突出了我们方法在大规模应用和实时工业中的实用性。6. 结论在本工作中我们提出了一个成本效益高且可适应的语义蒸馏框架该框架在不增加推理或部署开销的情况下增强了基于DETR的实时目标检测器。通过所提出的深度语义注入器DSI和梯度引导的自适应调制GAM我们的方法有效地将视觉基础模型的高级语义以稳定且与任务对齐的方式转移到轻量级检测器中。在COCO上的广泛实验表明在多个模型尺度上均实现了一致且显著的性能提升最终形成了最先进的RT-DETRv4系列。这些结果突出了明确语义监督在弥合大规模基础模型与资源高效检测架构之间差距的有效性。总体而言我们的工作为解锁基础模型在高效视觉任务中的潜力提供了一条实用的路径。

相关新闻