Skip to main content
QUICK REVIEW

[论文解读] GENESIS-V2: Inferring Unordered Object Representations without Iterative Refinement

Martin Engelcke, Ōiwi Parker Jones|arXiv (Cornell University)|Apr 20, 2021
Advanced Neural Network Applications被引用 16
一句话总结

GENESIS-V2 提出了一种基于可微嵌入的聚类方法,采用随机棒棒糖过程(IC-SBP)推断无序、可变数量的对象表征,无需迭代优化或循环神经网络(RNNs)。该方法在合成数据集和复杂真实世界数据集(如 Sketchy 和 APC)上的无监督图像分割与以对象为中心的生成任务中均达到了最先进性能。

ABSTRACT

Advances in unsupervised learning of object-representations have culminated in the development of a broad range of methods for unsupervised object segmentation and interpretable object-centric scene generation. These methods, however, are limited to simulated and real-world datasets with limited visual complexity. Moreover, object representations are often inferred using RNNs which do not scale well to large images or iterative refinement which avoids imposing an unnatural ordering on objects in an image but requires the a priori initialisation of a fixed number of object representations. In contrast to established paradigms, this work proposes an embedding-based approach in which embeddings of pixels are clustered in a differentiable fashion using a stochastic stick-breaking process. Similar to iterative refinement, this clustering procedure also leads to randomly ordered object representations, but without the need of initialising a fixed number of clusters a priori. This is used to develop a new model, GENESIS-v2, which can infer a variable number of object representations without using RNNs or iterative refinement. We show that GENESIS-v2 performs strongly in comparison to recent baselines in terms of unsupervised image segmentation and object-centric scene generation on established synthetic datasets as well as more complex real-world datasets.

研究动机与目标

  • 解决现有无监督对象中心模型依赖 RNN 或迭代优化所带来的局限,二者均引入了不自然的排序或导致可扩展性差的问题。
  • 开发一种方法,可在无需预先初始化固定数量对象槽的情况下,推断可变数量的对象表征。
  • 实现像素嵌入到注意力掩码的端到端可微聚类,用于无监督实例分割与场景生成。
  • 在视觉与结构复杂度高的真实世界数据集上提升泛化能力与鲁棒性,这些数据集中先前的模型难以将前景对象与背景分离。
  • 在合成基准数据集与具有挑战性的真实世界数据集上验证该方法,证明其在分割与生成任务中均表现优异。

提出的方法

  • 提出实例着色棒棒糖过程(IC-SBP),一种可微聚类机制,通过从像素嵌入中随机采样聚类种子来生成软注意力掩码。
  • 利用 IC-SBP 将像素嵌入分组为无序、可变大小的对象表征集合,无需迭代优化或 RNN。
  • 将 IC-SBP 集成到变分自编码器框架中,联合学习推理与生成过程,实现以对象为中心的场景生成。
  • 采用对象槽上的自回归先验来建模对象之间的关系,灵感源自原始 GENESIS 模型。
  • 利用可微聚类实现反向传播通过分割过程,支持端到端训练,无需后处理。
  • 将模型应用于合成数据集(ObjectsRoom、ShapeStacks)和真实世界数据集(Sketchy、APC),且在对象数量与身份上均无监督。

实验结果

研究问题

  • RQ1可微聚类机制能否替代迭代优化或 RNN,用于在无监督场景理解中学习无序对象表征?
  • RQ2在像素嵌入上应用随机棒棒糖过程,能否在无需预先初始化槽位的情况下,实现可变数量且解耦的对象表征?
  • RQ3该方法在具有高度视觉与结构多样性的复杂真实世界图像上泛化能力如何?
  • RQ4该模型能否在无监督图像分割与以对象为中心的场景生成任务中均取得具有竞争力的性能,且无需监督?
  • RQ5缺乏循环处理是否能提升训练稳定性并防止模型坍缩至单一对象槽?

主要发现

  • 在 APC 数据集上,GENESIS-V2 达到了最高的 ARI(0.55)与 MSC(0.67)得分,优于所有基线模型,包括 slot-attention 与 genesis。
  • 在 Sketchy 数据集上,GENESIS-V2 达到了最低的 FID 得分(208.1),表明其在以对象为中心的图像生成中样本质量更优。
  • 在评估的模型中,GENESIS-V2 是唯一一个在具有挑战性的 APC 数据集中成功将前景对象与背景分离的模型。
  • 定性结果表明,GENESIS-V2 能够清晰区分 Sketchy 中的各个独立对象及机械臂抓手,且在处理复杂真实世界场景时优于 slot-attention。
  • 该模型在视觉复杂性下表现出鲁棒性,并能泛化至真实世界数据,尽管偶尔存在过度分割对象的现象,表明仍有改进空间。
  • GENESIS-V2 在合成基准数据集(ObjectsRoom、ShapeStacks)上表现优异,证实其在受控、以对象为中心环境中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。