[论文解读] Semi-Supervised Video Salient Object Detection Using Pseudo-Labels
本文提出了一种半监督视频显著性目标检测框架,通过光流和稀疏人体标注生成高质量的像素级伪标签,仅使用约20%的真实标签即实现了最先进性能。该方法结合了残差优化网络与非局部增强循环模块,以利用时空一致性,在DAVIS、FBMS和VOS基准上超越了完全监督的最先进方法。
Deep learning-based video salient object detection has recently achieved great success with its performance significantly outperforming any other unsupervised methods. However, existing data-driven approaches heavily rely on a large quantity of pixel-wise annotated video frames to deliver such promising results. In this paper, we address the semi-supervised video salient object detection task using pseudo-labels. Specifically, we present an effective video saliency detector that consists of a spatial refinement network and a spatiotemporal module. Based on the same refinement network and motion information in terms of optical flow, we further propose a novel method for generating pixel-level pseudo-labels from sparsely annotated frames. By utilizing the generated pseudo-labels together with a part of manual annotations, our video saliency detector learns spatial and temporal cues for both contrast inference and coherence enhancement, thus producing accurate saliency maps. Experimental results demonstrate that our proposed semi-supervised method even greatly outperforms all the state-of-the-art fully supervised methods across three public benchmarks of VOS, DAVIS, and FBMS.
研究动机与目标
- 通过利用稀疏人工标注和伪标签,降低完全监督视频显著性目标检测的高标注成本。
- 通过运动感知的伪标签生成,提升显著性预测中的时间一致性和边界准确性。
- 开发一种可泛化至无监督视频目标分割任务而无需额外训练的框架。
- 验证通过光流和优化网络生成的伪标签能否在性能上超越完全监督基线方法。
提出的方法
- 提出RCRNet,一种基于上采样优化的残差优化网络,用于生成高分辨率显著性图。
- 引入非局部增强循环(NER)模块,以建模长距离空间与时间依赖关系,提升一致性。
- 使用FlowNet 2.0估计帧间光流,实现基于运动的稀疏真实标签传播。
- 通过光流对相邻标注进行变形,并将结果与RGB及运动特征在改进的RCRNet中融合,生成伪标签。
- 端到端训练模型,同时使用稀疏真实标签和光流引导的伪标签,以增强空间与时间建模能力。
- 采用多尺度监督与跳跃连接,以保留细粒度细节并减少梯度消失。
实验结果
研究问题
- RQ1能否通过稀疏标注与光流生成的伪标签提升视频显著性目标检测性能?
- RQ2所提出的光流引导伪标签生成方法在保留边界细节与时间一致性方面有多高效?
- RQ3仅使用约20%真实标签训练的半监督模型能否超越完全监督的最先进方法?
- RQ4非局部增强循环模块在显著性预测中提升时空一致性方面有多大作用?
- RQ5所提出的框架是否能泛化至无监督视频目标分割任务?
主要发现
- 在DAVIS基准上,该方法实现了0.861的平均F-measure,超越了所有完全监督的最先进方法。
- 在FBMS数据集上,该方法实现了75.9%的Jaccard指数,显著优于第二名方法(LVO为65.1%)。
- 消融实验表明,与无伪标签基线(0.821)相比,伪标签生成使F-measure提升了0.026(0.847)。
- 与标准ConvGRU基线相比,非局部增强循环模块使F-measure提升了0.004,证明其在建模长距离依赖关系方面的有效性。
- 该模型在无监督视频目标分割任务中也实现了最先进性能,在DAVIS上Jaccard得分为74.7,在FBMS上为75.9,表明其具备强大的泛化能力。
- 该方法仅需完全监督方法所用真实标注约20%的标注量,显著降低了标注成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。