Skip to main content
QUICK REVIEW

[논문 리뷰] Combating Mode Collapse in GANs via Manifold Entropy Estimation

Haozhe Liu, Bing Li|arXiv (Cornell University)|2022. 08. 25.
Anomaly Detection Techniques and Applications인용 수 4
한 줄 요약

이 논문은 모드 붕괴를 극복하기 위해 생성기의 샘플 분포의 엔트로피를 극대화하고, 판별기의 구조를 일반화하여 구조적인 임bedding 공간을 학습하는 새로운 GAN 훈련 파이프라인인 MaEM-GAN을 제안한다. 맨ifold 정규화(DLLE 및 DIsoMap)와 리플레이 버퍼 기반 비모수적 엔트로피 추정기 도입을 통해 생성 샘플의 다양성을 향상시키면서도 품질을 유지하며, 벤치마크 데이터셋에서 최신 기술을 능가한다.

ABSTRACT

Generative Adversarial Networks (GANs) have shown compelling results in various tasks and applications in recent years. However, mode collapse remains a critical problem in GANs. In this paper, we propose a novel training pipeline to address the mode collapse issue of GANs. Different from existing methods, we propose to generalize the discriminator as feature embedding and maximize the entropy of distributions in the embedding space learned by the discriminator. Specifically, two regularization terms, i.e., Deep Local Linear Embedding (DLLE) and Deep Isometric feature Mapping (DIsoMap), are designed to encourage the discriminator to learn the structural information embedded in the data, such that the embedding space learned by the discriminator can be well-formed. Based on the well-learned embedding space supported by the discriminator, a non-parametric entropy estimator is designed to efficiently maximize the entropy of embedding vectors, playing as an approximation of maximizing the entropy of the generated distribution. By improving the discriminator and maximizing the distance of the most similar samples in the embedding space, our pipeline effectively reduces the mode collapse without sacrificing the quality of generated samples. Extensive experimental results show the effectiveness of our method, which outperforms the GAN baseline, MaF-GAN on CelebA (9.13 vs. 12.43 in FID) and surpasses the recent state-of-the-art energy-based model on the ANIME-FACE dataset (2.80 vs. 2.26 in Inception score). The code is available at https://github.com/HaozheLiu-ST/MEE

연구 동기 및 목표

  • 고품질 출력에도 불구하고 생성 샘플의 다양성이 제한되는 GAN의 지속적인 문제인 모드 붕괴를 해결하기 위해.
  • 판별기의 역할을 이진 분류기에서 데이터 맨ifold의 구조를 유지하는 특징 임베딩기로 재정의하여 GAN의 훈련 안정성과 다양성을 향상시키기 위해.
  • 판별기가 학습한 임베딩 공간 내에서의 엔트로피를 최적화하여 생성 분포의 엔트로피를 간접적으로 극대화하기 위해.
  • 복잡한 분할 함수 계산이 불가능한 고차원 데이터에 적합하게, 리플레이 버퍼를 기반으로 한 비모수적 엔트로피 추정 방법을 개발하기 위해.
  • 잘 구조화된 임베딩 공간에서의 엔트로피 극대화가 표준 GAN과 최근의 에너지 기반 모델을 뛰어넘는 다양성과 정밀도를 달성할 수 있음을 입증하기 위해.

제안 방법

  • 판별기를 스칼라 출력이 아닌 깊은 특징 임베딩을 출력하도록 일반화하여, 실재 및 생성 이미지를 m차원 공간으로 매핑하는 특징 임베딩기로 전환한다.
  • 임베딩 공간 내에서 국소 및 전반적인 맨ifold의 구조를 유지하기 위해 Deep Local Linear Embedding(DLLE)과 Deep Isometric feature Mapping(DIsoMap)를 정규화 항으로 도입한다.
  • 리플레이 버퍼 기반의 비모수적 엔트로피 추정기(RB-MaEM)를 설계하여 임베딩 분포의 엔트로피를 효율적으로 근사하고 극대화한다.
  • 임베딩 벡터의 엔트로피를 극대화하는 것으로 훈련 목표를 설정하여, 이는 생성 데이터 분포의 엔트로피 극대화를 대체로 수행하는 역할을 한다.
  • 엔트로피 극대화 목표를 GAN 훈련 루프에 통합하여, 적대적 손실을 유지하면서도 임베딩 공간을 통해 다양성을 증진시킨다.
  • 심층적이고 복잡한 모델에 일반적으로 적용 가능한 방식으로, 최소한의 아키텍처 수정을 통해 표준 GAN 아키텍처(예: StyleGAN-V2, BigGAN)에 적용함으로써 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1학습된 임베딩 공간에서 생성 분포의 엔트로피를 극대화하는 것이 실제로 GAN의 모드 붕괴를 효과적으로 줄일 수 있는가?
  • RQ2판별기를 어떻게 재구성하면 데이터의 내재 맨ifold의 구조를 유지하여 신뢰할 수 있는 엔트로피 추정을 지원할 수 있는가?
  • RQ3리플레이 버퍼 기반의 비모수적 엔트로피 추정기는 고차원 임베딩 공간에서 효율적이고 정확하게 엔트로피를 추정할 수 있는가?
  • RQ4임베딩 공간에서의 엔트로피 극대화가 표준 GAN과 비교해 이미지 품질을 떨어뜨리지 않으면서도 샘플 다양성을 향상시키는가?
  • RQ5이 방법이 벤치마크 데이터셋에서 최신 기술의 에너지 기반 모델을 다양성과 정밀도 지표 모두에서 능가할 수 있는가?

주요 결과

  • CelebA에서 MaEM-GAN은 FID 9.13을 기록하여 MaF-GAN 기준선(12.43)을 크게 능가하며, 더 뛰어난 다양성과 품질을 입증했다.
  • ANIMEFACE 데이터셋에서 MaEM-GAN은 Inception Score 2.80을 기록하여 최근 최고 수준의 에너지 기반 모델인 EBM-BB(2.26)를 초월했다.
  • RB-MaEM을 포함할 경우 I-Variance 점수는 3.41에서 4.88로 상승하여 샘플 다양성 향상의 효과를 입증했다.
  • 심층 아키텍처인 StyleGAN-V2 및 BigGAN에 적용했을 때도 이 방법은 항상 훈련 안정성과 성능 향상을 보였다.
  • 제거 실험 결과, DLLE와 DIsoMap가 잘 구조화된 임베딩 공간을 형성하여 효과적인 엔트로피 극대화를 가능하게 하기 위해 필수적임을 확인했다.
  • 임베딩 차원별 상위 샘플 시각화 결과, 판별기가 색상, 스타일 등 다양한 특징을 기반으로 진위를 평가하는 것을 확인하여, 이 방법이 다각도의 데이터 변동성을 효과적으로 포착할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.