Skip to main content
QUICK REVIEW

[논문 리뷰] DiVAE: Photorealistic Images Synthesis with Denoising Diffusion Decoder

Jie Shi, Chenfei Wu|arXiv (Cornell University)|2022. 06. 01.
Generative Adversarial Networks and Image Synthesis인용 수 11
한 줄 요약

DiVAE는 이미지 임베딩을 조건으로 하는 노이즈 제거 확산 디코더를 갖춘 VQ-VAE 프레임워크를 제안하여 이산적 임베딩에서 사진처럼 사실적인 이미지를 생성한다. 텍스트-이미지 합성에서 최고 수준의 FID 점수(11.53)를 달성하며, 특히 자동회귀 모델에서 유도된 임베딩을 사용할 경우 세밀한 세부 사항을 재구성하는 데에서 이전 방법들을 능가한다.

ABSTRACT

Recently most successful image synthesis models are multi stage process to combine the advantages of different methods, which always includes a VAE-like model for faithfully reconstructing embedding to image and a prior model to generate image embedding. At the same time, diffusion models have shown be capacity to generate high-quality synthetic images. Our work proposes a VQ-VAE architecture model with a diffusion decoder (DiVAE) to work as the reconstructing component in image synthesis. We explore how to input image embedding into diffusion model for excellent performance and find that simple modification on diffusion's UNet can achieve it. Training on ImageNet, Our model achieves state-of-the-art results and generates more photorealistic images specifically. In addition, we apply the DiVAE with an Auto-regressive generator on conditional synthesis tasks to perform more human-feeling and detailed samples.

연구 동기 및 목표

  • 기존 VAE 디코더 대신 확산 기반 디코더를 도입하여 다단계 생성 모델에서 이미지 임베딩의 재구성 품질을 향상시키는 것.
  • 고품질 이미지 생성을 위해 이산적 이미지 임베딩에 효과적으로 조건을 주는 확산 모델의 구현 방법을 탐구하는 것.
  • 사진처럼 사실적인 이미지 재구성과 세밀한 세부 사항 유지와 함께 이미지 재구성 및 텍스트-이미지 합성에서 최고 수준의 성능을 달성하는 것.
  • 확산 모델의 UNet 아키텍처에 대한 수정 사항을 탐색하여 다양한 네트워크 깊이에서 이미지 임베딩을 효과적으로 통합할 수 있도록 하는 것.

제안 방법

  • 이산 임베딩 잠재 코드에서 이미지를 재구성하도록 훈련된 노이즈 제거 확산 디코더를 갖춘 VQ-VAE 아키텍처인 DiVAE를 제안한다.
  • 특정 레이어, 특히 최적의 성능을 위해 버블넥트(bottleneck) 블록에서 이미지 임베딩을 연결하거나 덧셈으로 통합함으로써 표준 UNet 아키텍처를 수정한다.
  • 전방 노이징 과정을 역행하는 노이즈 제거 확산 과정을 활용해 잠재 코드에서 고품질 이미지를 생성한다.
  • 노이즈 제거 과정 동안 공간 정보를 유지하기 위해 UNet 내 잔차 연결 기반 스킵 커넥션 구조를 사용한다.
  • 조건부 생성 작업에서 샘플 품질을 향상시키기 위해 추론 중에 분류기 없는 가이던스(classifier-free guidance)를 적용한다.
  • ImageNet 256×256에서 훈련하고, 텍스트-이미지 합성을 위해 자동회귀 사전 모델로 미세조정한다.

실험 결과

연구 질문

  • RQ1이산 임베딩에서 이미지를 생성하기 위해 VQ-VAE 프레임워크 내에서 확산 모델을 효과적으로 디코더로 사용할 수 있는가?
  • RQ2UNet 아키텍처에서 이미지 임베딩을 통합하는 데 가장 효과적인 위치는 어디인가? 재구성 정밀도를 최적화하기 위해.
  • RQ3연결(concatenation), 덧셈(addition), 또는 어텐션 기반 통합 방식이 생성된 이미지 품질에 어떤 영향을 미치는가?
  • RQ4기존 VAE나 자동회귀 디코더 대비 확산 디코더를 사용할 경우 다단계 합성에서 이미지의 세부 사항과 현실감이 향상되는가?
  • RQ5자기회귀 사전 모델과 결합했을 때 DiVAE는 텍스트-이미지 생성에서 최고 수준의 성능을 달성할 수 있는가?

주요 결과

  • DiVAE는 MSCOCO 256×256 텍스트-이미지 벤치마크에서 FID 점수 11.53을 기록하여, 제로샷 FID에서 DALL-E2(10.39)와 VQ-Diffusion(13.86)을 모두 능가한다.
  • 기존 기준 모델 대비 더 사진처럼 사실적이고 세밀한 이미지를 생성하며, 특히 눈과 머리카락과 같은 세밀한 구조를 재구성하는 데 뛰어나다.
  • UNet의 중간(bottleneck) 블록에 이미지 임베딩을 통합할 경우 FID 점수가 11.58로 가장 우수하며, 인코더나 디코더 블록에 통합하는 것보다 유의미하게 뛰어나다.
  • 중간 블록에서 임베딩을 연결하거나 덧셈으로 통합할 경우 유사한 성능(FID 11.58 vs. 11.61)을 기록하여 둘 다 효과적임을 시사하며, 어텐션 기반 통합은 성능이 열 劣하다(FID 13.35).
  • 동일한 잠재 코드를 사용한 NUWA와 비교했을 때 DiVAE는 고주파 수면과 얼굴 특징에서 더 현실적이고 세밀한 이미지를 생성한다.
  • 강력한 재구성 능력 덕분에 다단계 합성에서 더 높은 압축 비율을 지원하며, 이는 더 효율적인 사전 훈련을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.