Skip to main content
QUICK REVIEW

[论文解读] MOVE: Unsupervised Movable Object Segmentation and Detection

Adam Bielski, Paolo Favaro|arXiv (Cornell University)|Oct 14, 2022
Visual Attention and Saliency Detection被引用 6
一句话总结

MOVE 提出了一种自监督方法,通过利用局部物体位移的物理合理性作为监督信号,实现无监督可移动物体的分割与检测。该方法使用预训练的自监督学习特征(如 DINO、MAE),结合修复网络与对抗性训练,检测因前景位移产生的分割伪影,从而在单物体发现任务中实现平均 CorLoc 提升 7.2%,在无类别感知检测任务中实现相对 AP 提升 53%,达到当前最先进性能。

ABSTRACT

We introduce MOVE, a novel method to segment objects without any form of supervision. MOVE exploits the fact that foreground objects can be shifted locally relative to their initial position and result in realistic (undistorted) new images. This property allows us to train a segmentation model on a dataset of images without annotation and to achieve state of the art (SotA) performance on several evaluation datasets for unsupervised salient object detection and segmentation. In unsupervised single object discovery, MOVE gives an average CorLoc improvement of 7.2% over the SotA, and in unsupervised class-agnostic object detection it gives a relative AP improvement of 53% on average. Our approach is built on top of self-supervised features (e.g. from DINO or MAE), an inpainting network (based on the Masked AutoEncoder) and adversarial training.

研究动机与目标

  • 开发一种无需人工标注掩码或边界框的自监督方法,实现无监督物体分割与检测。
  • 利用可移动前景物体可被局部位移以生成真实图像的物理特性,作为监督信号。
  • 在无监督显著物体检测与无类别感知物体检测任务上,超越现有 SotA 方法的性能。
  • 避免依赖生成模型或复杂场景合成,转而使用修复与基于位移的伪影检测进行训练。

提出的方法

  • 该方法使用预训练的视觉 Transformer(如 DINO 或 MAE 编码器)作为冻结主干网络,提取自监督特征。
  • 基于类似 U-Net 的上采样 CNN 构建分割头,从这些特征中预测前景掩码。
  • 使用基于 MAE 并引入对抗性损失的修复网络,从掩码图像中重建背景。
  • 通过将预测的前景物体局部位移并粘贴到修复后的背景上,生成合成图像。
  • 利用合成图像中的伪影(如纹理不匹配或重复区域)作为监督信号:正确的掩码应使此类伪影最小化。
  • 通过判别器对真实图像与虚假合成图像(位移后)以及虚假拼接图像(位移前景粘贴到原始图像)进行区分,对分割器进行对抗性训练。

实验结果

研究问题

  • RQ1物体可移动性这一物理特性能否作为无监督物体分割的强而可靠的监督信号?
  • RQ2基于位移诱发伪影的方法是否能在自监督特征的无监督分割任务中超越聚类方法?
  • RQ3不依赖生成模型训练或合成数据生成,是否能带来更好的泛化能力与性能?
  • RQ4基于可移动性的监督在多大程度上能提升显著物体检测与无类别感知物体检测基准的性能?

主要发现

  • 在 VOC07、VOC12 和 COCO20K 上的无监督单物体发现任务中,MOVE 相较于 SotA 方法实现了平均 CorLoc 提升 7.2%。
  • 在 COCOval2017 上的无监督无类别感知物体检测任务中,MOVE 将 AP50 提升 6.8%(相对提升 56%),AP75 提升 2.3%(相对提升 55%),AP 提升 2.7%(相对提升 49%)。
  • 该方法在多样化数据集(包括 DUTS-TR)上展现出强大的泛化能力,性能可与监督基线方法相媲美。
  • 消融实验证实,可移动性作为监督信号比重建误差或聚类方法更具鲁棒性。
  • 使用合成图像进行对抗性训练可增强图像真实感,显著提升边界区域的掩码质量。
  • 通过连通组件后处理可恢复多个物体,但因可移动性模糊性,仍可能遗漏部分物体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。