Skip to main content
QUICK REVIEW

[论文解读] Object-Centric Image Generation with Factored Depths, Locations, and Appearances

Titas Anciukevicius, Christoph H. Lampert|arXiv (Cornell University)|Apr 1, 2020
Generative Adversarial Networks and Image Synthesis参考文献 25被引用 8
一句话总结

本文提出了一种完全无监督的、以物体为中心的生成模型,能够将图像内容分解为具有显式2D位置、深度、外观和非模态分割掩码的独立物体。通过利用结构化的潜在空间和非学习的、可微分的图像合成过程,该模型在无任何监督的情况下,学习到图像重建、生成完整物体(即使被遮挡)以及推断准确的深度排序和被遮挡部分,实现了无监督设置下的最先进非模态分割性能。

ABSTRACT

We present a generative model of images that explicitly reasons over the set of objects they show. Our model learns a structured latent representation that separates objects from each other and from the background; unlike prior works, it explicitly represents the 2D position and depth of each object, as well as an embedding of its segmentation mask and appearance. The model can be trained from images alone in a purely unsupervised fashion without the need for object masks or depth information. Moreover, it always generates complete objects, even though a significant fraction of training images contain occlusions. Finally, we show that our model can infer decompositions of novel images into their constituent objects, including accurate prediction of depth ordering and segmentation of occluded parts.

研究动机与目标

  • 开发一种生成模型,能够在无需任何物体级别标注的情况下,将图像分解为具有显式2D位置、深度和外观的物体。
  • 使模型能够生成完整且合理的物体和场景,即使在训练图像中存在遮挡。
  • 在无监督条件下,推断新图像中物体的非模态分割(包括隐藏部分)和正确的深度排序。
  • 在潜在空间中实现解耦且可解释的表征,将物体外观、位置和深度分离。

提出的方法

  • 该模型使用结构化的潜在空间,为背景和每个物体分别设置变量,包括外观嵌入、2D位置、深度和alpha掩码。
  • 采用非学习的、可微分的图像合成过程,根据物体的位置、深度和alpha掩码进行组合,模拟真实的遮挡效果。
  • 通过变分推断进行训练,仅从原始像素中估计物体因子以重建输入图像。
  • 物体的位置和深度被显式建模为潜在变量,使模型能够推理遮挡顺序和非模态范围。
  • 解码器使用深度神经网络独立生成每个物体的外观,而合成过程则确保物理上的合理性。
  • 该模型利用关于图像形成过程的先验知识(例如深度排序、alpha合成),而非从数据中学习这些机制。

实验结果

研究问题

  • RQ1完全无监督的生成模型能否学习将图像分解为具有显式2D位置、深度和非模态掩码的物体?
  • RQ2此类模型能否在无任何分割标注的情况下,推断被遮挡物体的完整(非模态)范围?
  • RQ3结构化的潜在空间是否允许对物体位置、外观和深度实现解耦控制?
  • RQ4该模型能否在新图像中准确预测重叠物体之间的深度排序?

主要发现

  • 在重叠多边形数据集上,模型的平均非模态IOU达到0.90;在CLEVR-3上达到0.85,表明其在无监督条件下具有强大的非模态分割能力。
  • 在CLEVR-5-vbg上,该模型的非模态IOU为0.65,仍显著高于随机水平,该数据集包含小物体和复杂背景。
  • 在CLEVR-3上,模型对92%的重叠物体对预测了正确的深度排序;在重叠多边形数据集上为87%;在CLEVR-5-vbg上为70%。
  • 潜在空间中的解耦插值表明,物体外观和位置可独立变化而不会产生视觉伪影,证实了表征的解耦性。
  • 即使训练图像中存在显著遮挡,模型仍能生成逼真且连贯的场景以及合理的孤立物体。
  • 在图像生成质量和解耦性方面,该模型优于同等容量的非物体中心基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。