Skip to main content
QUICK REVIEW

[论文解读] LayoutVAE: Stochastic Scene Layout Generation From a Label Set

Akash Abdu Jyothi, Thibaut Durand|arXiv (Cornell University)|Jul 24, 2019
Generative Adversarial Networks and Image Synthesis参考文献 32被引用 14
一句话总结

LayoutVAE 是一种变分自编码器框架,通过建模对象之间的空间关系和数量关系,从标签集合中生成随机且多样的场景布局。它能够实现多样化的布局生成,通过似然得分检测异常布局,并在 MNIST-Layouts 和 COCO 2017 Panoptic 数据集上表现出色。

ABSTRACT

Recently there is an increasing interest in scene generation within the research community. However, models used for generating scene layouts from textual description largely ignore plausible visual variations within the structure dictated by the text. We propose LayoutVAE, a variational autoencoder based framework for generating stochastic scene layouts. LayoutVAE is a versatile modeling framework that allows for generating full image layouts given a label set, or per label layouts for an existing image given a new label. In addition, it is also capable of detecting unusual layouts, potentially providing a way to evaluate layout generation problem. Extensive experiments on MNIST-Layouts and challenging COCO 2017 Panoptic dataset verifies the effectiveness of our proposed framework.

研究动机与目标

  • 解决缺乏从弱监督(即仅提供标签集合而无关系细节)生成多样化、合理布局的随机布局生成模型的问题。
  • 从视觉数据中学习场景内对象之间的内在空间和数量关系,而非依赖显式的文本或结构化描述。
  • 开发一种能够为同一标签集合生成多个有效布局的框架,以反映现实场景中固有的模糊性和变异性。
  • 通过模型学习的似然得分,实现对不切实际或异常布局的检测。
  • 为现有图像生成模型提供可插拔的组件,作为其布局输入,从而提升生成结果的真实感和多样性。

提出的方法

  • 采用变分自编码器(VAE)架构,通过独立的推理网络和先验网络来建模对象布局的联合分布。
  • 通过从训练数据统计中学习的每类标签的对象数量分布来建模数量关系。
  • 通过条件先验建模空间关系,基于已生成的对象预测边界框位置。
  • 采用分层生成过程:首先预测对象数量,然后通过自回归条件逐步生成边界框。
  • 利用 1000 个后验样本进行重要性采样,以估计负对数似然(NLL),用于布局异常检测。
  • 构建了一个合成数据集 MNIST-Layouts,定义了布局规则(如大数字位于中心,小数字位于底部),以验证模型对组合规则的学习能力。

实验结果

研究问题

  • RQ1深度生成模型能否仅从标签集合中学习生成多样化、合理的场景布局,而无需显式的关系监督?
  • RQ2该模型在真实世界图像分布中,对对象之间空间和数量关系的捕捉与泛化能力如何?
  • RQ3通过测量在学习分布下的似然,该模型在多大程度上能够检测出异常或不合理的布局?
  • RQ4该模型在不同复杂度的数据集(如合成的 MNIST-Layouts 和真实世界的 COCO)之间是否具有泛化能力?
  • RQ5标签处理顺序如何影响模型性能?标签排列对布局生成质量有何影响?

主要发现

  • LayoutVAE 在同一标签集合下成功生成了多样化且逼真的布局,该结果在 MNIST-Layouts 和 COCO 2017 Panoptic 数据集上均得到验证。
  • 该模型能够高精度检测异常布局:将布局翻转 180 度后,92.58% 的测试图像 NLL 值上升,平均 NLL 从 2.26 上升至 4.33。
  • 当图像间标签顺序被随机化时,性能显著下降,表明一致的标签顺序有助于学习空间规则。
  • 该模型在 MNIST-Layouts 中学习并强制执行了合成布局规则,如将较大的数字置于中心,较小的数字置于底部。
  • LayoutVAE 逐步生成连贯且多样的边界框预测,高概率区域与合理的对象位置对齐。
  • 该框架与现有图像生成模型兼容,可生成有效的布局输入,例如 Zhao et al. [31] 的模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。