Skip to main content
QUICK REVIEW

[논문 리뷰] Associative Adversarial Networks

Tarik Arici, Aslı Çelikyılmaz|arXiv (Cornell University)|2016. 11. 18.
Generative Adversarial Networks and Image Synthesis참고 문헌 12인용 수 9
한 줄 요약

이 논문은 GAN의 생성자와 판별자 사이에 제한된 볼츠만 기계(RBM)를 확률적 연상 기억으로 삽입하는 연관적 적대망(AANs)을 제안한다. 판별자의 중간 특징에 대한 확률적 분포를 학습함으로써 RBM은 구조적이고 모드가 rich한 입력을 생성하여 생성자의 매핑 작업을 단순화시키며, 이는 표준 GAN에 비해 더 안정적인 훈련과 향상된 샘플 다양성으로 이어진다. 표준 GAN은 균일한 노이즈를 사용한다.

ABSTRACT

We propose a higher-level associative memory for learning adversarial networks. Generative adversarial network (GAN) framework has a discriminator and a generator network. The generator (G) maps white noise (z) to data samples while the discriminator (D) maps data samples to a single scalar. To do so, G learns how to map from high-level representation space to data space, and D learns to do the opposite. We argue that higher-level representation spaces need not necessarily follow a uniform probability distribution. In this work, we use Restricted Boltzmann Machines (RBMs) as a higher-level associative memory and learn the probability distribution for the high-level features generated by D. The associative memory samples its underlying probability distribution and G learns how to map these samples to data space. The proposed associative adversarial networks (AANs) are generative models in the higher-levels of the learning, and use adversarial non-stochastic models D and G for learning the mapping between data and higher-level representation spaces. Experiments show the potential of the proposed networks.

연구 동기 및 목표

  • 표준 GAN에서 발생하는 불안정성과 모드 붕괴 문제를 해결하기 위해, 생성자가 균일한 노이즈를 복잡한 데이터 분포로 매핑하는 데 어려움을 겪는 데 기인한 문제를 해결한다.
  • 생성자의 학습 부담을 줄이기 위해 균일한 노이즈 입력을 고수준 표현 공간에서의 구조적이고 모드 인식 가능한 샘플로 대체한다.
  • 중간 판별자 특징의 확률적 구조를 모델링하는 연상 기억을 활용함으로써 훈련 동역학을 향상시킨다.
  • 학습된 고수준 표현에서 샘플링이 더 다양하고 현실적인 생성된 샘플을 이끌어내는지 경험적으로 검증한다.

제안 방법

  • RBM은 판별자가 추출한 중간 특징에 대해 연상 기억으로 훈련되어 이러한 고수준 표현의 기저 확률 분포를 학습한다.
  • Gibbs 샘플링을 RBM에 적용하여 생성자에게 구조적이고 균일하지 않은 입력을 생성함으로써 표준 균일한 노이즈 z를 대체한다.
  • 생성자는 RBM의 가시층에서 유도된 샘플에 조건을 받으며, 이는 판별자의 특징 공간에 대한 학습된 분포에서 유도된다.
  • 판별자는 실제 데이터와 생성된 샘플을 구분하도록 훈련되며, 생성자는 RBM 샘플링된 입력을 사용하여 판별자를 속이도록 훈련된다.
  • 합동 훈련 과정은 판별자, RBM, 생성자를 번갈아 업데이트하며, RBM은 의미 있는 특징 구성에 대한 확률적 사전 분포 역할을 한다.
  • 모델은 셀레바(CelebA) 데이터셋을 사용하여 검증되며, 생성된 이미지의 보존 가능도와 시각적 품질을 평가하여 RBM의 표현 능력과 일반화 능력을 평가한다.

실험 결과

연구 질문

  • RQ1RBM과 같은 연상 기억 모델이 판별자의 중간 특징에 대한 구조적 사전 분포를 학습함으로써 GAN의 훈련 안정성과 다양성을 향상시킬 수 있는가?
  • RQ2균일한 노이즈를 RBM 샘플링된 입력으로 대체함으로써 생성자의 학습 부담이 감소하고 모드 붕괴가 완화되는가?
  • RQ3중간 특징 공간의 차원 수가 RBM의 Gibbs 샘플러의 혼합 속도와 모드 커버리지에 미치는 영향은 어떠한가?
  • RQ4표준 GAN에 비해 RBM이 학습한 분포가 생성된 이미지의 품질과 다양성에 얼마나 기여하는가?

주요 결과

  • 100차원의 중간 특징 공간을 사용할 경우 RBM의 Gibbs 샘플러에서 빠른 혼합이 이루어져 얼굴 이미지의 성별, 인종 등의 모드 간 신속한 전환을 가능하게 하였다.
  • 1000차원의 특징 공간을 사용할 경우 RBM는 모드 간 전환을 위해 최대 10단계의 Gibbs 스텝이 필요하여 느린 혼합과 분포 탐색의 열악함을 보였다.
  • RBM 샘플링된 입력을 사용하여 훈련된 생성자는 수렴 행동이 향상되었으며, 실제 데이터와 생성된 데이터에 대한 판별자 점수 비율이 표준 GAN보다 더 안정적으로 수렴하였다.
  • 보존 가능도 평가를 통해 RBM이 판별자의 중간 특징에 대한 의미 있는 비퇴화 확률 분포를 학습했다는 것이 확인되었다.
  • 시각적 샘플을 통해 RBM 샘플링된 입력이 더 다양하고 현실적인 얼굴 이미지를 생성하는 것으로 나타났으며, 특히 저차원 특징 공간에서 두드러졌다.
  • 연상 기억은 생성자의 학습 과제를 효과적으로 완화시켜 붕괴 위험을 줄이고 더 안정적인 적대적 훈련을 가능케 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.