Skip to main content
QUICK REVIEW

[논문 리뷰] Generate High Resolution Images With Generative Variational Autoencoder

Abhinav Sagar|arXiv (Cornell University)|2020. 08. 12.
Generative Adversarial Networks and Image Synthesis참고 문헌 35인용 수 6
한 줄 요약

이 논문은 고해상도 이미지를 생성하기 위해 변분 자동인코더(VAE)와 GAN 유사 판별기의 조합을 시도하는 새로운 생성 모델을 제안한다. VAE 디코더를 유지하지 않고 판별기로 대체함으로써 인코더를 유지함으로써 이미지의 선명도와 여러 지표에서 성능이 향상되었으며, MNIST, LSUN, CelebA 데이터셋에서 이전 최고 성능 모델들을 능가한다.

ABSTRACT

In this work, we present a novel neural network to generate high resolution images. We replace the decoder of VAE with a discriminator while using the encoder as it is. The encoder is fed data from a normal distribution while the generator is fed from a gaussian distribution. The combination from both is given to a discriminator which tells whether the generated image is correct or not. We evaluate our network on 3 different datasets: MNIST, LSUN and CelebA dataset. Our network beats the previous state of the art using MMD, SSIM, log likelihood, reconstruction error, ELBO and KL divergence as the evaluation metrics while generating much sharper images. This work is potentially very exciting as we are able to combine the advantages of generative models and inference models in a principled bayesian manner.

연구 동기 및 목표

  • 고해상도 이미지를 더 뛰어난 시각적 품질로 생성할 수 있는 딥 생성 모델을 개발하는 것.
  • 변분 추론(또는 VAE)과 적대적 훈련(GAN)의 장점을 원칙적인 베이지안 프레임워크 내에서 통합하는 것.
  • 기존 VAE가 선명한 이미지를 생성하는 데 한계를 보이는 점을 보완하기 위해 디코더를 판별기로 교체하는 것.
  • MMD, SSIM, 로그우도, 재구성 오차 등 다양한 지표를 사용하여 다양한 데이터셋에서 모델을 평가하는 것.

제안 방법

  • 표준 정규분포에서 잠재 코드를 추출하기 위해 VAE의 인코더를 유지하고, 이를 잠재 표현으로 매핑한다.
  • 동일한 잠재 코드를 사용하는 생성망이 기존 VAE 디코더의 기능을 대체하여 이미지 샘플을 생성한다.
  • 실제 이미지와 생성된 이미지를 구별하기 위해 판별기를 훈련시켜 적대적 피드백을 제공한다.
  • VAE 목표(ELBO, KL 발산)와 적대적 손실을 조합하여 이미지 품질을 향상시키기 위해 엔드 투 엔드로 모델을 훈련시킨다.
  • 잠재 코드는 가우시안 사전분포에서 샘플링되며, 생성망은 이러한 샘플에 조건을 두고 이미지를 생성한다.
  • 재구성, 우도, 적대적 목표를 동시에 최적화하여 신뢰도와 다양성을 향상시킨다.

실험 결과

연구 질문

  • RQ1VAE 디코더를 판별기로 교체함으로써 고해상도 이미지의 품질을 향상시킬 수 있는가?
  • RQ2제안된 VAE-GAN 하이브리드 모델은 선명도와 지표 성능 측면에서 최고 성능 모델들과 비교해 어떻게 성과를 내는가?
  • RQ3변분 추론과 적대적 훈련을 결합함으로써 베이지안 프레임워크 내에서 생성 품질이 얼마나 향상되는가?
  • RQ4이 모델은 MNIST, LSUN, CelebA와 같은 다양한 데이터셋에 일반화되는가?

주요 결과

  • 제안된 모델은 MMD, SSIM, 로그우도, 재구성 오차 등 다양한 평가 지표에서 MNIST, LSUN, CelebA 데이터셋에서 최고 성능을 기록한다.
  • 표준 VAE와 비교해 유의미하게 더 선명한 이미지를 생성하며, 시각적 품질 향상과 낮은 재구성 오차로 이를 입증한다.
  • VAE와 GAN 구성요소의 조합으로 인해 더 나은 ELBO와 낮은 KL 발산을 달성하여 후행 분포 근사가 향상됨을 나타낸다.
  • 원칙적인 베이지안 방식으로 실재성 있고 다양한 고해상도 이미지를 생성하는 데 이전 방법들을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.