Skip to main content
QUICK REVIEW

[논문 리뷰] Disentangled Inference for GANs with Latently Invertible Autoencoder

Jiapeng Zhu, Deli Zhao|arXiv (Cornell University)|2019. 06. 19.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

이 논문은 잠재 공간에 대칭적인 역가능한 네트워크를 통합한 이중 단계 방법인 잠재 역가능한 오토에코더(Latently Invertible Autoencoder, LIA)를 제안한다. 이는 GAN의 분리된 추론을 가능하게 한다. GAN 디코더를 먼저 훈련한 후 별도의 오토에코더를 통해 분리된 인코더를 학습함으로써, 이전 방법들에 비해 향상된 이미지 복원 성능과 더 빠른 수렴 속도를 달성하며, FFHQ 및 LSUN 데이터셋에서 최신 기술 수준의 성능을 기록한다.

ABSTRACT

Generative Adversarial Networks (GANs) play an increasingly important role in machine learning. However, there is one fundamental issue hindering their practical applications: the absence of capability for encoding real-world samples. The conventional way of addressing this issue is to learn an encoder for GAN via Variational Auto-Encoder (VAE). In this paper, we show that the entanglement of the latent space for the VAE/GAN framework poses the main challenge for encoder learning. To address the entanglement issue and enable inference in GAN we propose a novel algorithm named Latently Invertible Autoencoder (LIA). The framework of LIA is that an invertible network and its inverse mapping are symmetrically embedded in the latent space of VAE. The decoder of LIA is first trained as a standard GAN with the invertible network and then the partial encoder is learned from a disentangled autoencoder by detaching the invertible network from LIA, thus avoiding the entanglement problem caused by the random latent space. Experiments conducted on the FFHQ face dataset and three LSUN datasets validate the effectiveness of LIA/GAN.

연구 동기 및 목표

  • 실제 이미지가 잠재 공간에 안정적으로 인코딩되지 않는 GAN 추론의 근본적 과제를 해결하기 위해.
  • VAE 기반 GAN 추론 방법에서 성능이 열악한 이유로 잠재 공간(z-공간)의 엉키는 성질을 특정하기 위해.
  • 이미지 생성 품질을 훼손하지 않으면서 정확하고 분리된 잠재 코드 추론을 가능하게 하는 방법을 개발하기 위해.
  • 디코더 사전 훈련과 인코더 학습을 분리하는 이중 단계 훈련 체계를 설계하여 엉킴 문제를 피하기 위해.

제안 방법

  • LIA는 오토에코더의 잠재 공간 내부에 역가능한 네트워크와 그 역함수를 대칭적으로 통합하여, 잠재 코드와 이미지 특징 간의 이중 방향 매핑을 가능하게 한다.
  • 디코더는 먼저 역가능한 네트워크를 사용하여 잠재 공간에서 이미지 공간으로 매핑하는 방식으로 표준 GAN으로 사전 훈련된다.
  • 그 후, 역가능한 네트워크를 분리한 후 분리된 오토에코더를 통해 인코더를 학습함으로써 학습된 잠재 코드가 분리됨을 보장한다.
  • 이 방법은 이중 단계 훈련 과정을 사용한다: 먼저 역가능한 네트워크를 갖춘 GAN을 훈련하고, 이후 분리된 잠재 공간에서 인코더를 훈련한다.
  • 역가능한 네트워크 덕분에 정확한 재구성과 함께, 최적화 안정성을 향상시키기 위해 인코더를 통해 잠재 코드를 초기화할 수 있다.
  • 이 프레임워크는 디코더를 어떤 GAN 생성기로도 교체할 수 있어, 이미지 편집 및 데이터 증강과 같은 다양한 응용이 가능하다.

실험 결과

연구 질문

  • RQ1VAE 기반 GAN 추론 방법은 변분 추론을 사용하고도 높은 재구성 품질을 달성하지 못하는 이유는 무엇인가?
  • RQ2원래의 잠재 공간(z-공간)의 엉킴과 비교할 때, 중간 잠재 공간(y-공간)의 분리성은 추론 성능에 어떤 영향을 미치는가?
  • RQ3잠재 공간에 대칭적인 역가능한 네트워크를 통합하면 GAN 역가속의 정확성과 안정성이 향상되는가?
  • RQ4LIA의 인코더 출력을 최적화의 초기화로 사용할 경우, 무작위 또는 평균 기반 초기화보다 수렴 속도가 빠르고 재구성 품질이 뛰어나지는가?
  • RQ5이중 단계 훈련 체계는 GAN 생성과 인코더 학습을 효과적으로 분리하면서도 분리성을 유지할 수 있는가?

주요 결과

  • LIA는 FFHQ 데이터셋에서 가장 뛰어난 재구성 품질을 기록했으며, 비교된 방법들 중에서 가장 높은 FID 및 LPIPS 점수를 확보했다.
  • LIA의 인코더 출력을 초기화로 사용할 경우, 그림 12에서 보듯이 최적화 과정에서 더 빠른 수렴과 더 낮은 재구성 손실을 기록했다.
  • 재구성 정밀도와 수렴 속도 측면에서 LIA는 무작위 초기화 및 Image2StyleGAN에서 사용된 평균 기반 초기화보다 뚜렷이 뛰어났다.
  • 그림 9와 표 4의 정성적 결과는 LIA가 다른 방법들보다 몬라 리사의 헤어스타일과 같은 세부 사항을 더 정확하게 복원함을 확인한다.
  • y-공간(분리된)에서의 실험 결과는 z-공간(엉킨)에서의 최적화에 비해 더 뛰어난 수렴과 재구성 성능을 보였으며, 이는 분리성이 성공적인 GAN 역가속을 위해 필수적임을 증명한다.
  • 이중 단계 훈련 체계는 엉킴 문제를 효과적으로 피하며, GAN의 생성 능력을 훼손하지 않은 채 고성능의 인코더 학습을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.