[论文解读] Guess What Moves: Unsupervised Video and Image Segmentation by Anticipating Motion
本文提出了一种新颖的无监督方法,通过使用单张图像作为输入,训练网络以预测运动模式,实现视频和图像分割。通过将分割任务通过预测可能包含简单运动(例如仿射或二次流动)的区域这一掩码任务进行监督,该模型即使在物体静止时也能检测到物体,在视频分割基准上实现了最先进性能,并在静止图像中对新物体表现出强大的泛化能力。
Motion, measured via optical flow, provides a powerful cue to discover and learn objects in images and videos. However, compared to using appearance, it has some blind spots, such as the fact that objects become invisible if they do not move. In this work, we propose an approach that combines the strengths of motion-based and appearance-based segmentation. We propose to supervise an image segmentation network with the pretext task of predicting regions that are likely to contain simple motion patterns, and thus likely to correspond to objects. As the model only uses a single image as input, we can apply it in two settings: unsupervised video segmentation, and unsupervised image segmentation. We achieve state-of-the-art results for videos, and demonstrate the viability of our approach on still images containing novel objects. Additionally we experiment with different motion models and optical flow backbones and find the method to be robust to these change. Project page and code available at https://www.robots.ox.ac.uk/~vgg/research/gwm.
研究动机与目标
- 通过结合运动线索与外观学习,解决基于运动的分割在缺失静止物体时的局限性。
- 开发一种自监督框架,利用运动作为监督信号,而无需真实对象标注。
- 实现模型对训练期间未见的新物体的零样本泛化能力,适用于静止图像。
- 设计对运动模型和光流主干网络变化具有鲁棒性的方法。
- 在无监督视频对象分割基准上实现最先进性能,同时保持在图像分割任务中的可行性。
提出的方法
- 使用一个掩码任务进行分割网络训练:预测图像中可能包含简单运动模式(例如仿射或二次流动)的区域。
- 利用单帧输入的光流来监督网络,尽管在推理过程中模型并未直接观察到运动。
- 将训练损失公式化为在参数化运动模型下,预测区域与观测到的运动模式之间的兼容性度量。
- 避免直接预测运动,而仅关注识别运动模式的空间支持,从而在单图像设置中减少歧义。
- 在两种模式下应用同一网络:(1) 内部学习用于无监督视频分割,(2) 传导学习用于无监督图像分割。
- 在预测后集成CRF优化以提高边界精度,尤其在复杂场景中表现更优。
实验结果
研究问题
- RQ1能否在无标注的情况下,利用单张图像中的运动模式作为监督信号,学习到与对象相关的表征?
- RQ2在无运动存在的静止图像中,基于运动线索训练的模型能否泛化到分割新物体?
- RQ3该方法对运动模型假设(如仿射与二次)和光流主干网络架构变化的鲁棒性如何?
- RQ4预测运动模式是否能带来无监督视频对象分割的最先进性能?
- RQ5该模型能否在复杂场景和多样化物体类别下,实现高质量的静止图像分割?
主要发现
- 在DAVIS16基准上,该方法实现了最先进性能,平均IoU为80.7%(M),召回率为95.7%(R),优于以往的无监督方法。
- 在FBMS59数据集上,该模型在应用CRF优化后,平均IoU达到80.7%,表明其对多样化图像序列具有强大的泛化能力。
- 在CUB数据集上,该模型成功分割了不同姿态和背景下的鸟类,即使在使用包括DAVIS、FBMS和STv2在内的多样化数据集进行训练后依然表现良好。
- 该模型在静止图像上表现出有效的泛化能力,在DUT-OMRON、DUTS和ECSSD数据集上实现了高质量分割,包括包含多个前景物体的复杂场景。
- 消融研究显示,该方法对运动模型和光流主干网络的变化具有鲁棒性,在不同配置下均保持一致的性能表现。
- 失败案例主要出现在存在多个显著物体但仅一个被标注的情况下,表明其对评估中注释模糊性的敏感性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。