Skip to main content
QUICK REVIEW

[논문 리뷰] Variational Autoencoders with Normalizing Flow Decoders

Rogan Morrow, Wei-Chen Chiu|arXiv (Cornell University)|2020. 04. 12.
Generative Adversarial Networks and Image Synthesis참고 문헌 23인용 수 16
한 줄 요약

이 논문은 이미지 품질을 훼손하지 않고 학습 효율성을 향상시키기 위해 변분 오토에인드어(VAE)와 노멀라이징 플로우 디코더(Glow)를 조합한 하이브리드 생성 모델을 제안한다. VAE를 먼저 학습한 후 Glow 플로우로 미세조정함으로써, 독립적인 Glow보다 학습 시간을 3.5배 이상 단축시키면서도 경쟁 가능한 FID 점수와 비트-퍼-디멘션을 달성한다.

ABSTRACT

Recently proposed normalizing flow models such as Glow have been shown to be able to generate high quality, high dimensional images with relatively fast sampling speed. Due to their inherently restrictive architecture, however, it is necessary that they are excessively deep in order to train effectively. In this paper we propose to combine Glow with an underlying variational autoencoder in order to counteract this issue. We demonstrate that our proposed model is competitive with Glow in terms of image quality and test likelihood while requiring far less time for training.

연구 동기 및 목표

  • 구조적 제약로 인해 깊은 아키텍처가 필요한 Glow와 같은 노멀라이징 플로우 모델의 높은 계산 비용과 장시간 학습 문제를 해결하기 위해.
  • 제약적인 가우시안 가정과 독립적인 픽셀 디코더로 인해 일반적으로 흐릿한 이미지를 생성하는 표준 VAE의 샘플 품질을 향상시키기 위해.
  • likelihood 기반 생성 모델의 학습 속도를 높이기 위해 VAE의 압축된 잠재 공간을 정규화 플로우의 사전으로 활용함으로써.
  • 두 단계 학습 절차—먼저 VAE를 학습하고, 그 다음으로 Glow 플로우를 추가함—가 더 낮은 학습 시간으로도 경쟁 가능한 이미지 품질을 제공할 수 있음을 보여주기 위해.

제안 방법

  • 깊은 잔차 연결 인코더와 학습 가능한 대각 가우시안 디코더를 갖춘 표준 VAE를 사용하여 압축되고 분리 가능한 잠재 표현을 학습한다.
  • VAE의 잠재 공간 위에 단일 층의 Glow 정규화 플로우를 적용하여 복잡한 비정규 분포의 가능도를 모델링하고 생성된 샘플을 정교화한다.
  • VAE를 1,000 에포크 동안 먼저 학습한 후, 동일한 잠재 공간과 동일한 최적화 스케줄을 사용하여 Glow 플로우를 추가로 1,000 에포크 동안 미세조정한다.
  • 역행성이고 정규화 가능한 플로우 기반 변환을 가능하게 하기 위해, 각각 ReLU 활성화 함수를 갖는 두 개의 완전 연결 층으로 구성된 16개의 커파링 레이어를 사용하여 Glow 플로우를 구현한다.
  • 픽셀 단위의 가우시안 분포의 분산을 최적화하기 위해 VAE 디코더에 학습 가능한 스케일 파rameter γ를 도입하여 재구성 품질을 향상시킨다.
  • 두 단계 학습 절차를 적용: 먼저 의미 있는 잠재 공간을 학습하기 위해 VAE를 최적화하고, 그 다음으로 VAE의 잠재 코드를 Glow 플로우의 입력으로 사용하여 정밀 조정한다.

실험 결과

연구 질문

  • RQ1VAE와 정규화 플로우 디코더를 조합함으로써, 독립적인 Glow와 비교해 학습 시간을 단축시키면서도 이미지 품질을 유지하거나 향상시킬 수 있는가?
  • RQ2두 단계 학습 절차—먼저 VAE를 학습하고, 그 다음으로 Glow 플로우를 추가하는 방식—는 표준 VAE보다 더 높은 샘플 다양성과 더 선명한 이미지를 제공하는가?
  • RQ3VAE의 잠재 공간이 정규화 플로우의 효과적인 사전으로서 얼마나 잘 기능하는가? 이는 더 빠른 수렴과 더 나은 가능도 점수를 가능하게 하는가?
  • RQ4CIFAR-10과 CelebA에서 제안된 모델이 Glow, PixelCNN, Residual Flow와 같은 최신 기준 likelihood 기반 모델과 FID 및 비트-퍼-디멘션 측면에서 어떻게 비교되는가?
  • RQ5Glow 플로우가 VAE의 잠재 표현을 손상시키지 않고 내용을 유지하면서 세부 정보를 향상시키는 '선명화' 모듈로 작용할 수 있는가?

주요 결과

  • 제안된 모델은 CIFAR-10에서 Fréchet Inception Distance(FID) 42.14를 기록하여 Glow(46.90)를 능가하고, 다른 likelihood 기반 모델과 비교해도 경쟁 가능한 성능을 보였다.
  • CelebA에서 모델은 FID 20.59를 기록하여 Glow의 19.00보다 略로 높지만 경쟁 가능한 범위에 있으며, 비트-퍼-디멘션 ≤2.50을 달성했다.
  • 독립적인 Glow보다 학습 시간을 3.5배 이상 단축시켰다. 단일 GTX 1080 Ti에서 평균 에포크당 140초가 소요되었고, Glow는 약 512초였다.
  • 정성적 결과 분석에서 Glow 레이어가 '선명화' 모듈로 작용하는 것으로 나타났다: VAE 샘플은 흐릿한 반면, Glow를 통과한 후에는 내용이 유지되면서 눈에 띄게 선명해졌다.
  • 잠재 공간 내부 보간 결과는 모델이 압축되고 분리 가능한 표현을 학습하고 있음을 보여주었으며, 생성된 이미지 간의 부드러운 전이가 가능했다.
  • VAE에서 학습 가능한 디코더 분산을 사용함으로써 재구성 품질이 향상되었고, 정규화 플로우와 결합된 상태에서도 최적의 VAE 목표에 더 잘 부합하는 결과를 도출할 수 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.