Skip to main content
QUICK REVIEW

[论文解读] SlotDiffusion: Object-Centric Generative Modeling with Diffusion Models

Ziyi Wu, Jingyu Hu|arXiv (Cornell University)|May 18, 2023
Multimodal Machine Learning Applications被引用 6
一句话总结

SlotDiffusion 提出了一种新颖的以对象为中心的生成模型,利用潜在扩散模型(LDMs)提升从槽到图像的解码性能,在六个数据集上实现了无监督对象发现以及高保真图像和视频生成的最先进水平。通过用基于扩散的解码器替代传统的CNN或Transformer解码器,该方法显著减少了图像模糊和对象失真,同时实现了可控生成和改进的视频预测。

ABSTRACT

Object-centric learning aims to represent visual data with a set of object entities (a.k.a. slots), providing structured representations that enable systematic generalization. Leveraging advanced architectures like Transformers, recent approaches have made significant progress in unsupervised object discovery. In addition, slot-based representations hold great potential for generative modeling, such as controllable image generation and object manipulation in image editing. However, current slot-based methods often produce blurry images and distorted objects, exhibiting poor generative modeling capabilities. In this paper, we focus on improving slot-to-image decoding, a crucial aspect for high-quality visual generation. We introduce SlotDiffusion -- an object-centric Latent Diffusion Model (LDM) designed for both image and video data. Thanks to the powerful modeling capacity of LDMs, SlotDiffusion surpasses previous slot models in unsupervised object segmentation and visual generation across six datasets. Furthermore, our learned object features can be utilized by existing object-centric dynamics models, improving video prediction quality and downstream temporal reasoning tasks. Finally, we demonstrate the scalability of SlotDiffusion to unconstrained real-world datasets such as PASCAL VOC and COCO, when integrated with self-supervised pre-trained image encoders.

研究动机与目标

  • 解决现有基于槽的模型生成质量较差的问题,这些模型由于解码能力弱而产生模糊图像和失真对象。
  • 通过用强大的潜在扩散模型(LDM)解码器替代传统解码器,提升从槽到图像的解码质量。
  • 利用通过无监督对象发现学习到的以对象为中心的表示,实现高保真、可控的图像和视频生成。
  • 通过与自监督预训练图像编码器集成,将该方法扩展到真实世界数据集(如 PASCAL VOC 和 COCO),展示其可扩展性。
  • 通过与最先进动力学模型集成,使学习到的槽能够用于后续的时间推理和视频预测任务。

提出的方法

  • 引入潜在扩散模型(LDM)作为从槽到图像的解码器,其中对象槽用于条件化潜在图像特征的去噪过程。
  • 使用去噪目标训练LDM解码器,以从对象槽重建图像潜在表示,从而实现高保真图像生成。
  • 使用变自编码器(dVAE)在槽注意力之前将输入图像标记化为潜在表示,以实现高效且解耦的表征学习。
  • 应用槽注意力从图像潜在表示中提取以对象为中心的特征,生成一组可学习的、由注意力驱动的槽,用于表示场景中的实体。
  • 通过空间广播机制将LDM解码器与之结合,以关注空间位置,并生成基于槽条件化的像素级输出。
  • 通过与自监督预训练图像编码器(如 MoCo-v3)结合,将模型扩展到真实世界数据,实现对 COCO 和 PASCAL VOC 的零样本适应。

实验结果

研究问题

  • RQ1与传统的CNN或Transformer解码器相比,潜在扩散模型(LDM)解码器是否能显著提升以对象为中心模型的图像生成质量?
  • RQ2SlotDiffusion 学习到的以对象为中心的表征在多大程度上能支持下游任务,如视频预测和时间推理?
  • RQ3当与自监督预训练编码器结合时,SlotDiffusion 在 COCO 和 PASCAL VOC 等真实世界、非受限数据集上的泛化能力如何?
  • RQ4基于扩散的解码是否能带来更好的对象属性(如外观、位置)解耦以及更少的图像伪影?
  • RQ5SlotDiffusion 学习到的槽是否可直接与现有以对象为中心的动力学模型结合,以提升视频预测性能?

主要发现

  • SlotDiffusion 在六个数据集的无监督对象分割任务中达到最先进水平,MOVi-Solid 数据集上 FG-ARI 达到 69.13%,CLEVRTex 数据集上为 68.39%。
  • 在 CelebA-Mask 数据集上,SlotDiffusion 的 FID 达到 27.72,显著优于 SAVi(89.63)和 STEVE(78.95),表明其图像质量更优。
  • 在视频生成方面,SlotDiffusion 将 MOVi-Tex 上的 FVD 从 STEVE 的 704.6 降低至 242.2,表明其时间一致性和生成质量更优。
  • 当与以对象为中心的动力学模型集成时,SlotDiffusion 在 MOVi-E 上将 FVD 降低 46%,在 MOVi-Solid 上降低 47%,显著提升了视频预测性能。
  • 与 MoCo-v3 结合后,SlotDiffusion 在 COCO 和 PASCAL VOC 上实现了有效的泛化,无需微调即可达到强大的零样本性能。
  • 基于 LDM 的解码器显著降低了感知失真和模糊,MOVi-Tex 上的 LPIPS 仅为 0.11,远低于 STEVE 的 0.32 和 SAVi 的 0.40。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。