[论文解读] Learning Video Object Segmentation from Unlabeled Videos
本文提出 MuG,一种统一的无监督/弱监督视频实例分割框架,通过利用多粒度线索(帧级、短期、长程和全视频)从无标注视频中学习视频实例模式,无需像素级标注。该方法在实例级零样本VOS、实例级零样本VOS和单样本VOS设置下均达到最先进性能,显著降低了标注负担,同时保持高精度。
We propose a new method for video object segmentation (VOS) that addresses object pattern learning from unlabeled videos, unlike most existing methods which rely heavily on extensive annotated data. We introduce a unified unsupervised/weakly supervised learning framework, called MuG, that comprehensively captures intrinsic properties of VOS at multiple granularities. Our approach can help advance understanding of visual patterns in VOS and significantly reduce annotation burden. With a carefully-designed architecture and strong representation learning ability, our learned model can be applied to diverse VOS settings, including object-level zero-shot VOS, instance-level zero-shot VOS, and one-shot VOS. Experiments demonstrate promising performance in these settings, as well as the potential of MuG in leveraging unlabeled data to further improve the segmentation accuracy.
研究动机与目标
- 通过使模型能够从无标注视频中学习,减少视频实例分割(VOS)对昂贵像素级标注的严重依赖。
- 将多种VOS设置——实例级零样本、实例级零样本和单样本VOS——统一在一个无监督/弱监督框架下。
- 通过利用来自无标注数据的多粒度监督信号(包括显著性图、类激活图(CAM)激活和时序一致性),建模内在的视频实例模式。
- 通过挖掘视频数据中固有的启发式和结构特性,推进对VOS中视觉模式的理解。
提出的方法
- MuG 采用统一架构,整合多粒度监督信号:来自无监督显著性或CAM图的帧级线索、片段级表征中的短期一致性、远距离帧之间的长程对应关系,以及全局视频级紧凑性。
- 模型使用自监督对比学习目标,对齐不同帧之间的表征,增强对遮挡和外观变化的鲁棒性。
- 其优化目标统一整合了不同粒度的多种约束,实现端到端训练,无需真实掩码。
- 该方法通过预训练图像分类器的类激活图(CAMs)和显著性预测作为辅助监督信号,利用弱监督。
- 采用多阶段训练策略,通过先学习局部运动和外观模式,再强制实现长程一致性,逐步优化表征。
- 该框架通过利用学习到的视频实例模式,可灵活适配多种VOS设置,包括零样本和单样本推理。
实验结果
研究问题
- RQ1能否在不依赖昂贵像素级标注的前提下,从无标注视频中有效学习视频实例分割?
- RQ2如何联合利用多粒度线索(帧级、短期、长程和全视频)来建模内在的视频实例模式?
- RQ3一个统一的无监督/弱监督框架能否在包括实例级零样本VOS和单样本VOS在内的多种VOS设置中实现泛化?
- RQ4在缺乏真实掩码的情况下,来自CAMs或显著性图的弱监督能在多大程度上提升分割性能?
- RQ5与监督和自监督基线方法相比,该方法在不同数据集和设置下的准确率与泛化能力如何?
主要发现
- 在实例级零样本VOS上,MuG在DAVIS 17上的平均J&F达到14.8%的绝对提升,优于以往无监督方法。
- 在实例级零样本VOS设置下,MuG表现与全监督方法(如AGS和PDB)相当,显著优于RVOS,在无监督和弱监督设置下分别提升14.8%和19.2%的平均J&F。
- 在DAVIS 17的单样本VOS设置下,MuG的平均J&F达到54.3,超过之前最先进方法CorrFlow(50.3),证明其从无标注数据中学习模式的能力更优。
- 模型处理每帧的时间约为0.7秒(实例级Z-VOS)和0.4秒(实例级Z-VOS),相比以往自监督和匹配方法更为高效。
- 可视化结果表明,该模型在视角变化、背景杂乱、快速运动和尺度变化等挑战性条件下仍表现稳健,证实其强大的泛化能力。
- 消融研究证实,四种粒度层级(帧级、短期、长程和全视频)均对最终性能有显著贡献,验证了多粒度设计的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。