Skip to main content
QUICK REVIEW

[논문 리뷰] A Prior of a Googol Gaussians: a Tensor Ring Induced Prior for Generative Models

Maksim Kuznetsov, Daniil Polykovskiy|arXiv (Cornell University)|2019. 10. 29.
Generative Adversarial Networks and Image Synthesis인용 수 6
한 줄 요약

이 논문은 텐서 린 분해를 사용하여 고차원 격자에 10^100개가 넘는 가우시안을 압축하는 텐서 린 유도 사전(TRIP)을 제안한다. 이는 복잡하고 다모달한 분포를 효율적으로 모델링할 수 있도록 하며, GAN의 Fréchet Inception 거리(FID)와 VAE의 하한 추정 증거(ELBO)를 향상시킨다. 또한 일부 속성이 누락된 조건부 생성도 지원하여 표준 가우시안 및 GMM 사전보다 뛰어난 성능을 발휘한다.

ABSTRACT

Generative models produce realistic objects in many domains, including text, image, video, and audio synthesis. Most popular models---Generative Adversarial Networks (GANs) and Variational Autoencoders (VAEs)---usually employ a standard Gaussian distribution as a prior. Previous works show that the richer family of prior distributions may help to avoid the mode collapse problem in GANs and to improve the evidence lower bound in VAEs. We propose a new family of prior distributions---Tensor Ring Induced Prior (TRIP)---that packs an exponential number of Gaussians into a high-dimensional lattice with a relatively small number of parameters. We show that these priors improve Fréchet Inception Distance for GANs and Evidence Lower Bound for VAEs. We also study generative models with TRIP in the conditional generation setup with missing conditions. Altogether, we propose a novel plug-and-play framework for generative models that can be utilized in any GAN and VAE-like architectures.

연구 동기 및 목표

  • 표준 가우시안 사전보다 더 풍부한 사전 분포를 도입하여 GAN의 모드 붕괴 문제를 해결하고 VAE의 ELBO를 향상시키는 것.
  • 매우 많은 성분(10^100개 이상의 가우시안)을 포함하는 사전을 압축된 파rameter화 방식으로 모델링하는 것.
  • 일부 속성이 누락된 경우에도 효율적인 샘플링, 주변분포 계산 및 조건부 생성을 가능하게 하는 것.
  • 아ース티체처 변경 없이도 어떤 GAN 또는 VAE 아키텍처에나 즉시 적용 가능한 플러그 앤 플레이 사전을 개발하는 것.

제안 방법

  • 모드가 격자 위에 위치한 고차원 이산 또는 연속적 혼합가우시안모형(GMM)으로 사전 분포를 표현한다.
  • 텐서 린 분해를 사용하여 공동분포를 소수의 파라미터로 파arameter화함으로써 공동, 주변 및 조건부 확률의 효율적 계산을 가능하게 한다.
  • 잠재 벡터의 확률을 텐서 코어에서 유도된 행렬의 곱의 트레이스로 계산한다: $\widehat{P}[r_{1:d}] = \operatorname{Tr}\left(\prod_{j=1}^{d} Q_j[r_j]\right)$.
  • 텐서 코어에 학습 가능한 파라미터를 사용하여 연속 잠재 공간을 모델링하는 연속적 GMM로 방법을 확장한다.
  • 공동확률과 주변확률의 비율을 계산하여 조건부 생성을 지원하며, 부분적인 조건이 주어진 경우에도 샘플링이 가능하다.
  • 표준 VAE 또는 GAN 목표를 사용하여 엔드 투 엔드로 모델을 훈련시키며, TRIP를 사전 분포로 사용한다.

실험 결과

연구 질문

  • RQ110^100개 이상의 성분을 가진 사전이 표준 가우시안 사전보다 더 나은 생성 모델 품질을 가능하게 할 수 있는가?
  • RQ2텐서 린 분해와 같은 압축된 파라미터화 방식이 과적합 없이 고차원 다모달 사전을 효율적으로 표현할 수 있는가?
  • RQ3TRIP는 표준 사전 및 GMM 사전과 비교해 GAN의 FID와 VAE의 ELBO를 향상시키는가?
  • RQ4부분적으로만 속성이 제공된 경우에도 TRIP는 효과적인 조건부 생성을 가능하게 하는가?

주요 결과

  • WGAN-GP를 사용한 CelebA에서 TRIP는 FID를 52.86으로 낮춰 기준 WGAN-GP(54.71)와 SOTA인 SN-GAN(CIFAR-10 기준 21.7)을 모두 초월했다.
  • VAE-TRIP 모델은 ELBO를 -193.32로 기록하여 표준 VAE(가우시안 사전 기준 -194.16)와 GMM 사전 기반 VAE(-201.60)를 모두 개선했다.
  • CIFAR-10에서 WGAN-GP-TRIP는 FID를 16.72로 기록하여 WGAN-GP(29.3)를 크게 뛰어넘고 SOTA 성능에 가까워졌다.
  • 모드 이격 시각화 결과, 잠재 공간에서 가까운 모드는 의미적으로 유사한 이미지 변화를 나타내어 분리되고 국소화된 표현이 있음을 시사했다.
  • 부분 조건이 주어진 조건부 생성은 다양한 이미지를 생성했으며(예: 다양한 헤어 컬러, 안경 또는 모자를 쓴 젊은 남성들), 부분 조건에 대한 강건성을 입증했다.
  • 기하급수적인 성분 수에도 불구하고 TRIP는 전체 모델 파라미터의 10% 미만을 사용하여 과적합을 방지하고 효율적인 훈련을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.