尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

SSVOD: Semi-Supervised Video Object Detection with Sparse Annotations

SSVOD: Semi-Supervised Video Object Detection with Sparse Annotations 论文阅读 SSVOD: Semi-Supervised Video Object Detection with Sparse Annotations标题SSVOD: Semi-Supervised Video Object Detection with Sparse Annotations期刊2024 WACV目录论文阅读 SSVOD: Semi-Supervised Video Object Detection with Sparse Annotations创新点问题解决方案框架流扭曲特征集生成鲁棒伪标签选择三个选择阶段Cross-IoU(基于交叉交并比的伪边界框选择)Cross-Divergence(基于交叉散度的伪硬类别选择)Confidence-Aware Pseudo Soft Class Selectio感知置信度的伪软类别选择实验消融实验可视化结果创新点我们引入了一种新颖的半监督视频目标检测框架以应对带稀疏标注的视频目标检测的实际挑战。我们提出了一种基于运动感知的稳健伪类别标签和边界框过滤方法该方法利用了帧组的时间特征空间。我们进行了一项广泛的实验研究结果表明在ImageNetVID、Epic-KITCHENS和YouTube-VIS数据集上性能有显著提升。问题要在有监督的视频目标检测中取得良好性能在很大程度上取决于带注释帧的可用性。如果每个视频只有极其稀疏的1帧标注与15帧密集标注相比平均会观察到22%的有监督性能下降。图1. 监督学习的性能在很大程度上取决于每个视频中带标注帧的可用情况。我们提出的半监督视频目标检测SSVOD大幅缩小了稀疏标注1帧/视频与密集标注15帧/视频之间的性能差距。尽管视频中帧与帧之间存在较大的相关性但为每个视频的大量帧收集注释既昂贵又耗时而且往往是多余的。现有的针对静态图像的半监督技术很难利用视频中固有的时间运动动态信息。与静态图像相比视频带来了更多挑战尤其是在运动去模糊、姿态变化以及快速运动下相机失焦等方面。需要利用视频中丰富的时间信息来改进视频目标检测为静态图像定制的技术无法利用视频中丰富的时间信息在多帧图像中搜索可靠的伪标签。因此将基于图像的伪标签选择技术简单地集成到最先进的SOTA视频目标检测器中性能并不理想这就需要针对视频的更专业的解决方案。解决方案在本文中我们引入了SSVOD这是一个端到端的半监督视频目标检测框架它利用视频的运动动态信息以利用带有稀疏注释的大规模未标记帧。图2. (a) 有监督视频目标检测需要密集注释以探索视频的不同时间步长。(b) 对于稀疏注释由于时间探索不足有监督方法生成的性能欠佳。© 半监督视频目标检测SSVOD利用半监督学习通过利用可用的稀疏注释来估计不同时间步长的可靠伪标签从而减轻注释负担。我们提出了一种视频目标检测中的师生框架用于对稀疏标注的数据进行训练。我们不再仅仅对目标关键帧的最终图像级预测进行操作而是从每个相邻参考帧估计光流扭曲预测以便在伪标签选择中利用时间一致性估计图3。利用这些预测我们有选择地识别目标关键帧中目标类别和边界框最可靠的伪标签。我们在一组估计预测上引入了基于交叉交并比cross-IoU和交叉散度的选择方法分别为边界框和类别标签纳入可靠的伪标签为了在伪标签中的确认偏差和不确定性噪声之间取得平衡我们根据一致性将硬类别训练与软标签蒸馏相结合。框架有监督的视频目标检测主要侧重于从附近的参考帧中聚合周边上下文信息以增强对目标关键帧的检测。在视频中仅能获取稀疏标注的帧会限制有监督方法的时间学习能力图2b。考虑一个由M个视频组成的数据集D其中D({V{1}, V{2}, …, V{M}}) 。每个训练视频包含 (N) 帧其中有 (nk) 个带注释的关键帧和 (nr) 个参考帧满足 (nknrN) 。由参数化的视频目标检测网络的监督训练目标可以表示为其中 L是一个预定义的损失函数分别表示第 (m) 个视频中的第 (t) 个关键帧及其对应的注释。该半监督方法并非仅依赖于有标记的关键帧而是旨在为视频中所有未标记的关键帧生成可靠的伪标签图2c。因此可以利用有标记和伪标记的关键帧在视频的不同时间步上继续进行训练。假设每个视频包含个未标记关键帧和个有标记关键帧则半监督目标可定义如下其中表示为第(m)个视频的第(t)个未标记关键帧生成的伪标签。因此所提出的半监督公式确保了在整个视频中充分利用关键帧 - 参考帧对而不完全受限于人工标注。图3. 半监督视频目标检测SSVOD概述。每个有标记/无标记集合均由一个关键帧和若干参考帧组成。教师视频检测器对无标记集合进行操作以生成伪标签。流扭曲特征生成器利用运动流估计对参考特征进行变形生成流扭曲特征集。从原始特征集和流扭曲特征集生成的关键帧预测结果通过一个三阶段过滤方案进行处理以分离出伪边界框、硬类别标签和软标签。学生视频检测器使用伪标签在无标记集合上进行训练同时也在有标记集合上进行训练。一般来说在两阶段的最优视频检测器中视频特征提取器分别从每个关键帧和参考帧生成特征。随后视频区域提议网络RPN和感兴趣区域ROI头将参考特征聚合到关键特征中以在关键帧上生成原始预测。为了对这些原始预测利用时间一致性估计我们引入了使用光流估计器借助运动线索从每个参考帧估计光流扭曲预测。这些光流扭曲特征集与视频RPN和ROI头同时进行处理以估计目标关键帧上的光流扭曲预测。因此SSVOD并非生成单个关键帧预测而是利用最优两阶段视频检测器中一组帧上固有的时间特征积累基于运动光流估计预测集。Video Feature Extractor视频特征提取器提取视频帧的基础特征是检测任务的“感知层”。Flow-warped Feature Set Generator光流扭曲特征集生成器​Flow Estimator光流估计计算帧间运动光流描述像素运动轨迹。​Key Feature Estimator关键特征估计结合光流将参考帧特征“扭曲”到关键帧时序生成 Flow-warped Feature Sets光流扭曲特征集 目的是利用多帧时序信息辅助检测。​RPNRegion Proposal Network区域提议网络 生成候选边界框初步筛选可能含目标的区域。ROI Head感兴趣区域头 对候选框精细分类 回归输出原始预测Raw Predictions 。作为下一步我们估计生成的原始预测和光流扭曲预测之间的时间一致性以在未标注关键帧上有选择地过滤可靠的伪边界框和伪类别标签。对于伪边界框我们估计原始预测和光流扭曲预测中每对物体之间的交叉交并比IoU以过滤出保持高区域重叠的物体。对于伪类别标签方面我们进一步估计在区域重叠度高的对象对之间的类别预测中的交叉散度以筛选出在不同预测中具有高度一致性的类别标签。软标签有助于在具有更多标签噪声的类间关系上进行学习以应对更高的不确定性而对硬标签的错误估计会导致确认偏差。为了在两者之间取得平衡我们根据测量得到的类别标签一致性将硬标签训练与软标签蒸馏相结合。流扭曲特征集生成图4. 流扭曲特征集生成方案概述。流估计器提取每对关键参考帧之间的运动图。对每个参考特征进行特征扭曲。将关键特征替换为流扭曲特征以生成流扭曲特征集。受FGFA 的启发FGFA在视频目标检测中引入了光流引导的特征聚合我们提出光流扭曲特征集生成方法以估计时间预测的一致性。光流扭曲特征集包含所有参考图像特征以及由每个参考图像特征经运动扭曲生成的光流扭曲关键图像特征。第t个原始特征集包含在范围 [t - i, t i] 内某一特定视频的关键和参考图像特征其表示为其中分别表示从、图像帧生成的特征。一个光流网络F 用于生成每个关键 - 参考对的光流图特征扭曲模块W利用得到的运动映射对每个参考图像特征进行操作以生成光流扭曲关键特征。因此从给定的关键 - 参考特征估计得到的光流扭曲特征集由下式给出一般来说在训练时每个特征集中仅使用两个参考帧和一个关键帧。因此这些集合的估计在计算上是高效的。鲁棒伪标签选择三个选择阶段Cross-IoU(基于交叉交并比的伪边界框选择)我们基于最大重叠估计原始预测与每个光流扭曲关键帧预测之间的目标对匹配。对于第 t 帧中的第 k 个目标在第 (t j) 个光流扭曲帧中匹配的目标估计为其中分别表示第 t 个关键帧和第 (t j) 个参考帧中的目标数量。接下来对于第 t 个原始预测的每个目标我们估计平均交叉交并比xIoU它代表边界框的一致性公式为最后我们筛选出具有高xIoU分数的目标以获得伪边界框其计算公式为其中是指示函数表示交并比阈值。Cross-Divergence(基于交叉散度的伪硬类别选择)基于交叉散度的伪硬类别选择。在某些情况下边界框估计可能准确但目标类别却错误。为解决此问题对于原始预测中的每个目标我们与其对应的光流扭曲目标一起估计平均交叉KL散度xDiv公式如下筛选出KL散度较低的边界框用于以阈值进行硬类别标注即Confidence-Aware Pseudo Soft Class Selectio感知置信度的伪软类别选择为加强对生成的伪标签的探索在对中剩余边界框的类别预测进行置信度阈值阈值为处理后将这些预测累加以生成软类别分布即在学生网络的类别预测与经筛选的、来自教师网络在时间 t 处的软类别分布之间执行软蒸馏公式为最后用于训练学生网络的目标损失定义为实验数据集 ImageNet-VID Epic-KITCHENS YouTube-VIS表1. 在每个视频仅设置一个标记关键帧且采样率不同的情况下以及在25%的训练视频中每个视频设置多个标记关键帧的情况下ImageNet-VID验证集上的性能比较。* 表示我们针对视频目标检测VOD任务的改进实现。所有结果均为三次独立运行的平均值。消融实验表2. 不同视频目标检测器的消融实验。我们的半监督视频目标检测SSVOD方案在各种检测器上相较于监督学习基线都有稳定提升。表 3.不同损失成分对伪标记影响的消融研究。表4. 不同数量未标记关键帧影响的消融研究。表6. 在单帧100% 视频设置下基于SSVOD框架使用最先进的视频目标检测VOD和光流估计器的额外研究。表7. 在单帧100% 的视频和多帧25% 的视频中每个视频5帧设置下在Epic-KITCHENS和YouTube-VIS数据集上的更多比较。可视化结果图5. 监督式和自监督视频目标检测SSVOD性能的定性可视化与监督式方法相比在具有挑战性的单目标和多目标场景中SSVOD在预测方面展现出更好的时间一致性。
返回列表