Skip to main content
QUICK REVIEW

[论文解读] Betrayed by Motion: Camouflaged Object Discovery via Motion Segmentation

Hala Lamdouar, Charig Yang|arXiv (Cornell University)|Nov 23, 2020
Image Enhancement Techniques参考文献 47被引用 8
一句话总结

本文提出一种基于运动的架构,用于通过可微分配准模块增强帧差分中的物体边界,并通过记忆增强的运动分割模块在运动间隙中保持物体持久性,从而在视频中发现伪装物体。该方法在新提出的MoCA基准上达到最先进性能,在仅使用光流作为输入的情况下,于DAVIS2016上也取得了具有竞争力的结果。

ABSTRACT

The objective of this paper is to design a computational architecture that discovers camouflaged objects in videos, specifically by exploiting motion information to perform object segmentation. We make the following three contributions: (i) We propose a novel architecture that consists of two essential components for breaking camouflage, namely, a differentiable registration module to align consecutive frames based on the background, which effectively emphasises the object boundary in the difference image, and a motion segmentation module with memory that discovers the moving objects, while maintaining the object permanence even when motion is absent at some point. (ii) We collect the first large-scale Moving Camouflaged Animals (MoCA) video dataset, which consists of over 140 clips across a diverse range of animals (67 categories). (iii) We demonstrate the effectiveness of the proposed model on MoCA, and achieve competitive performance on the unsupervised segmentation protocol on DAVIS2016 by only relying on motion.

研究动机与目标

  • 开发一种计算架构,通过利用运动线索发现视频中的伪装物体,因为仅靠外观特征不足以区分背景相似的物体。
  • 通过引入可微分配准模块,缓解光流估计的局限性,该模块通过配准后的帧差分增强边界检测。
  • 通过集成保持物体恒常性的记忆模块,实现运动间隙中物体身份的维持。
  • 建立大规模基准以评估伪装破除性能,解决现有数据集中缺乏多样化真实世界样本的问题。
  • 证明仅使用运动信号即可在标准基准(如DAVIS2016)上实现具有竞争力的无监督视频物体分割性能。

提出的方法

  • 可微分配准模块基于背景对连续视频帧进行对齐,生成突出物体边界的差分图像。
  • 注册帧之间的差分图像作为辅助监督信号,用于优化运动边界检测。
  • 具备循环记忆的运动分割模块可随时间处理光流,即使在运动短暂缺失时也能维持物体身份。
  • 通过结合分割损失与一致性损失,实现端到端训练,以提升模型鲁棒性。
  • 在提出的MoCA数据集和DAVIS2016基准上评估该架构,并通过消融研究隔离各组件的贡献。
  • 探索了双流扩展结构,通过融合独立的RGB外观流预测结果,在外观线索可用时进一步提升性能。

实验结果

研究问题

  • RQ1仅靠运动是否足以发现与背景视觉上难以区分的伪装物体?
  • RQ2在光流存在噪声或不准确的情况下,帧配准如何提升基于运动的物体边界检测质量?
  • RQ3记忆模块在运动间隙中能在多大程度上维持物体身份,从而提升分割一致性?
  • RQ4在标准视频分割基准(如DAVIS2016)上,纯运动模型与基于外观的模型相比表现如何?
  • RQ5仅基于运动训练的统一架构在高度挑战性的伪装场景和标准视频分割任务中是否具备良好泛化能力?

主要发现

  • 在MoCA基准的All_Motion协议下,所提模型达到39.4%的平均交并比(Jaccard index),显著优于仅依赖光流的基线方法。
  • 消融研究证实,记忆模块贡献显著,使All_Motion划分下的性能从25.5%提升至39.4%。
  • 在MoCA All_Motion划分上,该模型比MPNet(基于光流的基线)高出5.0个百分点,证明了配准与记忆组件的有效性。
  • 在DAVIS2016上,仅使用运动信号的模型达到65.3%的平均交并比,与使用外观线索的最先进方法相比具有竞争力。
  • 通过引入RGB外观流扩展模型后,MoCA上的性能提升至42.4%,表明当外观特征可用时可进一步增强分割效果。
  • 结果表明,即使在标准基准中,运动仍是强大的分割线索,但在视觉差异明显的场景中,外观特征仍占主导地位。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。