Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Moving Object Detection via Contextual Information Separation

Yanchao Yang, Antonio Loquercio|Zurich Open Repository and Archive (University of Zurich)|Jan 10, 2019
Anomaly Detection Techniques and Applications参考文献 33被引用 6
一句话总结

本文提出了一种利用对抗性上下文信息分离的无监督运动目标检测方法:生成器网络通过仅利用周围上下文预测光流来生成目标掩码,而修补器网络则仅使用外部上下文尝试重建被遮蔽的光流。该模型在无任何监督的情况下实现了最先进性能,通过对抗性训练中前景与背景假设之间的隐式竞争,超越了在大规模标注数据集上预训练的方法。

ABSTRACT

We propose an adversarial contextual model for detecting moving objects in images. A deep neural network is trained to predict the optical flow in a region using information from everywhere else but that region (context), while another network attempts to make such context as uninformative as possible. The result is a model where hypotheses naturally compete with no need for explicit regularization or hyper-parameter tuning. Although our method requires no supervision whatsoever, it outperforms several methods that are pre-trained on large annotated datasets. Our model can be thought of as a generalization of classical variational generative region-based segmentation, but in a way that avoids explicit regularization or solution of partial differential equations at run-time.

研究动机与目标

  • 开发一种完全无监督的运动目标检测方法,不依赖于大规模标注数据集的预训练。
  • 消除对显式正则化、超参数调优或推理时求解偏微分方程的需求。
  • 通过建模前景与背景运动之间的独立性,实现鲁棒、无需阈值的前景/背景分割。
  • 利用深度神经网络实现高效、可扩展的推理,同时在多样化场景中保持强泛化能力。
  • 在缺乏任何监督的情况下,实现在基准数据集上的竞争力表现。

提出的方法

  • 该方法采用生成器网络,仅利用图像其余部分的上下文信息,通过预测区域内的光流来生成目标掩码。
  • 训练一个对抗性修补器网络,仅使用周围上下文重建被遮蔽的光流,迫使生成器生成准确的掩码以误导修补器。
  • 生成器与修补器通过对抗方式联合训练,其中生成器的目标是生成使修补器在重建任务中失败的掩码。
  • 该架构采用编码器-解码器结构并结合跳跃连接,修补器网络具有两个独立的编码分支以提升上下文建模能力。
  • 训练目标基于最小化修补器的重建误差,同时最大化生成器遮蔽相关光流信息的能力。
  • 通过使用具有双边成对势能的CRF进行后处理,以优化预测的掩码。

实验结果

研究问题

  • RQ1是否可以仅依赖上下文信息和对抗性训练实现无监督的运动目标检测?
  • RQ2模型是否能在不依赖大规模标注数据集预训练的情况下超越监督基线方法?
  • RQ3通过对抗性上下文分离强制实现前景与背景运动的独立性,是否能带来鲁棒且可泛化的分割结果?
  • RQ4该方法是否能避免显式正则化、偏微分方程或超参数调优,同时保持高性能?
  • RQ5该方法在多样化场景、遮挡情况及复杂运动模式下的泛化能力如何?

主要发现

  • 所提方法在DAVIS2016数据集上达到最先进性能,平均交并比(J)为71.5%,F-measure(F)为86.5%,优于许多监督基线方法。
  • 在FBMS59数据集上,该方法达到平均J为63.6%、F为78.2%,表明其在多样化视频序列中具有强大泛化能力。
  • 在前景与背景运动完全独立的理想条件下,该方法实现了近乎完美的分割,验证了其核心假设的有效性。
  • 定性结果表明,该模型在部分遮挡、复杂边界和多尺度目标等挑战性情形下也表现出良好的泛化能力。
  • 尽管训练过程中未使用任何标注数据,该方法在基准测试中仍优于多个监督方法。
  • 消融研究证实,对抗性训练机制能有效防止平凡解,并在无需显式正则化的情况下实现鲁棒的掩码预测。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。