[논문 리뷰] SlotDiffusion: Object-Centric Generative Modeling with Diffusion Models
SlotDiffusion는 잠재 확산 모델(Latent Diffusion Models, LDMs)을 활용하여 슬롯에서 이미지로의 디코딩 성능을 향상시키는 새로운 개체 중심 생성 모델을 제안한다. 이는 여섯 개의 데이터셋에서 비지도 개체 발견 및 고해상도 이미지 및 영상 생성 분야에서 최신 기준(SOTA) 성능을 달성한다. 기존의 CNN 또는 Transformer 디코더 대신 확산 기반 디코더를 사용함으로써, 이미지 흐림과 개체 왜곡을 크게 줄이고 제어 가능한 생성 및 향상된 영상 예측을 가능하게 한다.
Object-centric learning aims to represent visual data with a set of object entities (a.k.a. slots), providing structured representations that enable systematic generalization. Leveraging advanced architectures like Transformers, recent approaches have made significant progress in unsupervised object discovery. In addition, slot-based representations hold great potential for generative modeling, such as controllable image generation and object manipulation in image editing. However, current slot-based methods often produce blurry images and distorted objects, exhibiting poor generative modeling capabilities. In this paper, we focus on improving slot-to-image decoding, a crucial aspect for high-quality visual generation. We introduce SlotDiffusion -- an object-centric Latent Diffusion Model (LDM) designed for both image and video data. Thanks to the powerful modeling capacity of LDMs, SlotDiffusion surpasses previous slot models in unsupervised object segmentation and visual generation across six datasets. Furthermore, our learned object features can be utilized by existing object-centric dynamics models, improving video prediction quality and downstream temporal reasoning tasks. Finally, we demonstrate the scalability of SlotDiffusion to unconstrained real-world datasets such as PASCAL VOC and COCO, when integrated with self-supervised pre-trained image encoders.
연구 동기 및 목표
- 약한 디코딩 능력으로 인해 블러진 이미지와 왜곡된 개체를 유발하는 기존 슬롯 기반 모델의 열악한 생성 품질을 해결한다.
- 기존 디코더를 강력한 잠재 확산 모델(Latent Diffusion Model, LDM) 디코더로 교체하여 슬롯에서 이미지로의 디코딩 품질을 향상시킨다.
- 비지도 개체 발견을 통해 학습된 개체 중심 표현을 활용하여 고해상도, 제어 가능한 이미지 및 영상 생성을 가능하게 한다.
- 자기지도 사전 훈련된 이미지 인코더와 통합하여 PASCAL VOC 및 COCO와 같은 실제 세계 데이터셋에 대해 모델의 확장성을 입증한다.
- 최신 동역학 모델과 통합하여 학습된 슬롯을 시간적 추론 및 영상 예측 작업에 후속적으로 활용할 수 있도록 한다.
제안 방법
- 개체 슬롯이 잠재 이미지 특징의 노이즈 제거 과정을 조절하는 잠재 확산 모델(Latent Diffusion Model, LDM)을 슬롯에서 이미지로의 디코더로 도입한다.
- 이미지 잠재 특징을 개체 슬롯에서 재구성하는 노이즈 제거 목표를 사용하여 LDM 디코더를 훈련함으로써 고해상도 이미지 생성을 가능하게 한다.
- 슬롯 어텐션 이전에 이미지 입력을 잠재 표현으로 토큰화하기 위해 dVAE를 사용하여 효율적이고 분리된 표현 학습을 가능하게 한다.
- 이미지 잠재 특징에서 개체 중심 특징을 추출하기 위해 슬롯 어텐션을 적용하여 장면 내 엔티티를 나타내는 학습 가능한, 어텐션 기반 슬롯 집합을 생성한다.
- 스페이셜 브로드캐스트 메커니즘과 LDM 디코더를 통합하여 공간적 위치에 주목하고 슬롯 조건에 따라 픽셀 수준의 출력을 생성한다.
- MoCo-v3와 같은 자기지도 사전 훈련된 이미지 인코더와 통합하여 실제 세계 데이터에 대해 모델을 확장함으로써 COCO 및 PASCAL VOC에 대한 제로샷 적응이 가능하게 한다.
실험 결과
연구 질문
- RQ1기존의 CNN 또는 Transformer 디코더와 비교해 볼 때, 잠재 확산 모델(Latent Diffusion Model, LDM) 디코더가 개체 중심 모델의 이미지 생성 품질을 크게 향상시킬 수 있는가?
- RQ2SlotDiffusion가 학습한 개체 중심 표현은 영상 예측 및 시간적 추론과 같은 후속 작업을 얼마나 잘 지원하는가?
- RQ3자기지도 사전 훈련된 인코더와 통합했을 때, SlotDiffusion는 COCO 및 PASCAL VOC와 같은 실제 세계의 제약 없는 데이터셋에 얼마나 잘 일반화되는가?
- RQ4확산 기반 디코딩을 사용할 경우, 개체 속성(예: 외관, 위치)의 분리도가 향상되고 이미지 아티팩트가 감소하는가?
- RQ5SlotDiffusion에서 학습된 슬롯은 기존의 개체 중심 동역학 모델과 직접 통합되어 영상 예측 성능을 향상시킬 수 있는가?
주요 결과
- SlotDiffusion는 여섯 개의 데이터셋에서 비지도 개체 세분화 분야에서 최신 기준(SOTA) 성능을 달성하였으며, MOVi-Solid에서 FG-ARI 69.13%, CLEVRTex에서 FG-ARI 68.39%를 기록하였다.
- CelebA-Mask 데이터셋에서 SlotDiffusion는 FID 27.72를 기록하여 SAVi(89.63)와 STEVE(78.95)를 크게 앞서며 우수한 이미지 품질을 입증하였다.
- 영상 생성 분야에서 SlotDiffusion는 MOVi-Tex에서 FVD를 704.6(SteinNet)에서 242.2로 감소시켜 시간적 일관성과 품질 향상을 보였다.
- 개체 중심 동역학 모델과 통합했을 때 SlotDiffusion는 MOVi-E에서 FVD를 46% 감소시키고, MOVi-Solid에서는 47% 감소시켜 영상 예측 성능을 향상시켰다.
- MoCo-v3와 통합했을 때 SlotDiffusion는 COCO 및 PASCAL VOC에 효과적으로 일반화되어 피팅 없이도 강력한 제로샷 성능을 달성하였다.
- LDM 기반 디코더는 MOVi-Tex에서 LPIPS 0.11을 기록하여 시각적 왜곡과 블러를 감소시켰으며, 이는 STEVE의 0.32 및 SAVi의 0.40보다 유의미하게 낮은 수준이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.