[论文解读] Motion-inductive Self-supervised Object Discovery in Videos
本文提出一种自监督视频实例分割模型 MOD,直接处理 RGB 帧以推断由运动引起的分割掩码,而无需将光流作为输入。通过使用随机配对策略并在推断的掩码上强制执行时间一致性,该方法在 DAVIS2016、SegTrackv2 和 FBMS-59 上实现了最先进性能,同时避免了光流计算开销。
In this paper, we consider the task of unsupervised object discovery in videos. Previous works have shown promising results via processing optical flows to segment objects. However, taking flow as input brings about two drawbacks. First, flow cannot capture sufficient cues when objects remain static or partially occluded. Second, it is challenging to establish temporal coherency from flow-only input, due to the missing texture information. To tackle these limitations, we propose a model for directly processing consecutive RGB frames, and infer the optical flow between any pair of frames using a layered representation, with the opacity channels being treated as the segmentation. Additionally, to enforce object permanence, we apply temporal consistency loss on the inferred masks from randomly-paired frames, which refer to the motions at different paces, and encourage the model to segment the objects even if they may not move at the current time point. Experimentally, we demonstrate superior performance over previous state-of-the-art methods on three public video segmentation datasets (DAVIS2016, SegTrackv2, and FBMS-59), while being computationally efficient by avoiding the overhead of computing optical flow as input.
研究动机与目标
- 为解决基于光流的方法在对象发现中的局限性,例如在静态或遮挡运动时失效的问题。
- 通过学习在某一时刻不运动时仍能跟踪对象,实现对象恒常性。
- 通过直接在 RGB 帧上进行训练,避免推理过程中计算光流的需求。
- 开发一种基于随机帧对和时间一致性的自监督代理任务,以指导掩码预测。
- 在保持计算效率的同时,在标准基准上实现更优的分割精度。
提出的方法
- 模型使用视觉编码器对连续的 RGB 帧进行编码,并通过晚期融合的 Transformer 编码器融合特征。
- 帧比较模块处理随机配对的帧特征,以编码相对运动,从而在无需显式光流输入的情况下实现运动推断。
- 双层光流重建头将运动特征解码为光流,每层的不透明度权重被视作分割掩码。
- 模型通过自监督代理任务进行训练:使用现成的光流估计器(如 RAFT)作为监督信号,重建随机帧对之间的光流。
- 在随机配对帧的推断掩码上应用时间一致性损失,以强化对象恒常性并提高对静态或部分遮挡对象的鲁棒性。
- 该架构在训练和推理过程中完全避免使用任何真实掩码标注,仅依赖 RGB 序列中的运动线索。
实验结果
研究问题
- RQ1能否仅使用 RGB 帧而无需依赖光流作为输入,让自监督模型在视频中发现运动物体?
- RQ2如何在推断的分割掩码上强制执行时间一致性,以提升在物体静止或被遮挡时的对象恒常性?
- RQ3对帧特征采用随机配对策略是否能有效诱导运动理解并提升分割性能?
- RQ4在挑战性条件下,利用 RGB 帧中的丰富纹理信息是否优于仅使用光流的基线方法?
- RQ5在完全无掩码监督的情况下训练的模型能否在标准视频分割基准上实现最先进性能?
主要发现
- 所提出的 MOD 模型在 DAVIS2016、SegTrackv2 和 FBMS-59 上实现了最先进性能,优于以往的自监督和有监督方法。
- 由于在随机配对帧上强制执行时间一致性,该模型在静态和部分遮挡物体上表现出更优的泛化能力。
- 通过避免显式光流计算,该方法相比基于光流的基线方法实现了更快的推理速度。
- 消融实验表明,随机配对策略和时间一致性损失对性能至关重要,尤其是在处理运动不连续性时。
- 利用 RGB 帧中的纹理丰富特征,相比仅依赖光流的基线方法,能实现更鲁棒、更准确的掩码预测,后者在运动线索微弱时会失效。
- 该模型通过在时间维度上挖掘纹理模式,成功学习了对象恒常性,即使在某一时刻物体未运动时亦能保持识别。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。