Skip to main content
QUICK REVIEW

[논문 리뷰] Exponential Tilting of Generative Models: Improving Sample Quality by Training and Sampling from Latent Energy

Zhisheng Xiao, Qing Yan|arXiv (Cornell University)|2020. 06. 15.
Generative Adversarial Networks and Image Synthesis참고 문헌 25인용 수 4
한 줄 요약

이 논문은 정규화 흐름과 VAE와 같은 사전 훈련된 우도 기반 생성 모델에서 샘플 품질을 향상시키기 위해 모델의 잠재 공간에 대해 에너지 기반 모델(EBM)을 훈련하는 방법을 제안한다. EBM는 최대우도 기반으로 잠재 변수를 개선하고, 이는 랭글레인 역동성에 의해 샘플링되어 계산 비용을 최소화하면서도 더 높은 품질의 선명한 이미지를 생성한다.

ABSTRACT

In this paper, we present a general method that can improve the sample quality of pre-trained likelihood based generative models. Our method constructs an energy function on the latent variable space that yields an energy function on samples produced by the pre-trained generative model. The energy based model is efficiently trained by maximizing the data likelihood, and after training, new samples in the latent space are generated from the energy based model and passed through the generator to producing samples in observation space. We show that using our proposed method, we can greatly improve the sample quality of popular likelihood based generative models, such as normalizing flows and VAEs, with very little computational overhead.

연구 동기 및 목표

  • 기본 모델을 재훈련하지 않고 사전 훈련된 우도 기반 생성 모델의 샘플 품질을 향상시키기 위해.
  • VAE와 정규화 흐름과 같은 비대칭 모델이 GAN보다 낮은 품질의 샘플을 생성하는 한계를 해결하기 위해.
  • 훈련 목표를 수정하는 대신 샘플링을 개선함으로써 샘플 품질을 향상시키는 방법을 개발하기 위해.
  • 사전 훈련된 생성기의 구조를 활용하는 잠재 EBM의 효율적인 훈련과 샘플링을 가능하게 하기 위해.
  • 에너지 기반 모델을 기존 우도 기반 생성 모델과 연결하는 일반적인 프레임워크를 제공하기 위해.

제안 방법

  • 사전 훈련된 생성 모델의 지수 기울기 구조를 정의함으로써 새로운 결합 분포를 구성한다: $ p_{\phi^{*},\theta}(\mathbf{x}) = \frac{p_{\phi^{*}}(\mathbf{x}) \exp(-E_{\theta}(\mathbf{x}))}{Z_{\phi^{*},\theta}} $, 여기서 $ E_{\theta}(\mathbf{x}) $는 데이터 공간에서의 에너지 함수이다.
  • 실제 데이터의 우도를 최대화함으로써 에너지 함수 $ E_{\theta}(\mathbf{x}) $를 훈련하며, 기울기 식은 $ \frac{\partial L(\theta)}{\partial\theta} = \mathbb{E}_{p_D}[\partial E_\theta / \partial\theta] - \mathbb{E}_{p_{\phi^{*},\theta}}[\partial E_\theta / \partial\theta] $ 로 주어진다.
  • 스토케스틱 기울기 랭글레인 역동성(SGLD)을 사용하여 잠재 EBM에서 샘플링을 수행하며, 이는 반복적으로 잠재 변수를 갱신함으로써 이루어진다: $ \mathbf{z}_{i+1} = \mathbf{z}_i - \frac{\epsilon}{2} \nabla_{\mathbf{z}} E_\theta(G_{\phi^*}(\mathbf{z})) + \sqrt{\epsilon} \mathbf{\omega} $, 여기서 $ \mathbf{\omega} \sim \mathcal{N}(0,\mathbf{I}) $이다.
  • 개선된 잠재 변수를 사전 훈련된 생성기 $ G_{\phi^*}(\mathbf{z}) $를 통해 복원함으로써 최종 샘플을 생성하며, 이는 샘플의 현실성과 선명도를 향상시킨다.
  • 정규화 흐름의 경우 100~200단계, VAE의 경우 최대 1,000단계로만 잠재 EBM을 훈련하여 계산 비용을 최소화한다.
  • 실제 데이터와 생성된 샘플을 사용하여 데이터 분포에 대해 끝에서 끝까지 훈련되는 동일한 에너지 함수 아키텍처(예: CNN)를 $ E_{\theta}(\mathbf{x}) $에 사용한다.

실험 결과

연구 질문

  • RQ1기본 모델을 재훈련하지 않고 사전 훈련된 우도 기반 생성 모델의 샘플 품질을 향상시킬 수 있는가?
  • RQ2사전 훈련된 생성기의 잠재 공간에 에너지 기반 모델을 훈련하면 더 선명하고 현실적인 샘플을 얻을 수 있는가?
  • RQ3본 연구에서 제안하는 방법은 훈련 목표를 수정하거나 GAN 스타일 디스크림ิน레이터 가이던스를 사용하는 기존 기법과 비교해 어떻게 성능을 냈는가?
  • RQ4잠재 EBM의 훈련에 드는 계산 비용은 얼마이며, 샘플 품질 향상에도 불구하고 이를 최소화할 수 있는가?
  • RQ5이 방법은 VAE, 정규화 흐름, 그리고 그들의 융합형과 같은 다양한 유형의 우도 기반 모델에 일반화될 수 있는가?

주요 결과

  • MNIST, 패션-MNIST, CIFAR-10에서 제안된 방법이 샘플 품질을 크게 향상시켰으며, GLOW에 잠재 EBM를 적용했을 때 MNIST의 FID 점수가 29.4에서 12.3으로 감소함으로써 이를 입증했다.
  • CIFAR-10에서 GLOW의 FID 점수는 잠재 EBM 적용 후 76.2에서 67.8로 향상되어 노이즈 감소와 더 나은 구조적 충실도를 보였다.
  • VAE의 경우 잠재 EBM를 적용했을 때 FID 점수가 18.9에서 16.0로 감소하여 원래 VAE 목표를 수정하지 않고도 더 나은 샘플 품질을 달성했다.
  • 두 단계 VAE나 플로우 기반 정규화 흐름을 갖춘 VAE와 같은 대안 기법보다 FID 기준으로 더 우수한 성능을 보였으며, 동시에 구조화된 잠재 공간을 유지했다.
  • 잠재 EBM의 훈련은 정규화 흐름의 경우 100~200단계, VAE의 경우 최대 1,000단계로 이루어져, 픽셀 공간에서의 전체 EBM 훈련에 비해 계산 비용이 매우 낮음을 보여주었다.
  • 정성적 결과에서는 잠재 EBM 샘플링이 더 선명하고 의미가 더 명확한 샘플을 생성하며, 특히 복잡한 데이터셋인 CIFAR-10에서 윤곽선이 매끄럽고 배경이 더 깔끔함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.