[논문 리뷰] Alleviating Mode Collapse in GAN via Diversity Penalty Module
이 논문은 생성적 적대적 네트워크(GANs)에서 모드 붕괴를 완화하기 위해 잠재 벡터 간 유사도와 그에 해당하는 생성된 이미지 특징 간 유사도 간 일관성을 강제하는 플러그인 방식의 다양성 페널티 모듈(PDPM)을 제안한다. 정규화된 그램 행렬을 사용해 특징 유사도를 측정하고, 일치하지 않는 유사도에 대해 페널티를 적용함으로써, 이미지 생성, 데이터 증강, 도메인 번역과 같은 다양한 작업에서 모드 커버리지, 이미지 품질, 일반화 능력 향상을 달성하며, 최소한의 계산 부담으로 최신 기술 수준(SOTA) 성능을 달성한다.
The vanilla GAN (Goodfellow et al. 2014) suffers from mode collapse deeply, which usually manifests as that the images generated by generators tend to have a high similarity amongst them, even though their corresponding latent vectors have been very different. In this paper, we introduce a pluggable diversity penalty module (DPM) to alleviate mode collapse of GANs. It reduces the similarity of image pairs in feature space, i.e., if two latent vectors are different, then we enforce the generator to generate two images with different features. The normalized Gram matrix is used to measure the similarity. We compare the proposed method with Unrolled GAN (Metz et al. 2016), BourGAN (Xiao, Zhong, and Zheng 2018), PacGAN (Lin et al. 2018), VEEGAN (Srivastava et al. 2017) and ALI (Dumoulin et al. 2016) on 2D synthetic dataset, and results show that the diversity penalty module can help GAN capture much more modes of the data distribution. Further, in classification tasks, we apply this method as image data augmentation on MNIST, Fashion- MNIST and CIFAR-10, and the classification testing accuracy is improved by 0.24%, 1.34% and 0.52% compared with WGAN GP (Gulrajani et al. 2017), respectively. In domain translation, diversity penalty module can help StarGAN (Choi et al. 2018) generate more accurate attention masks and accelarate the convergence process. Finally, we quantitatively evaluate the proposed method with IS and FID on CelebA, CIFAR-10, MNIST and Fashion-MNIST, and the results suggest GAN with diversity penalty module gets much higher IS and lower FID compared with some SOTA GAN architectures.
연구 동기 및 목표
- 다양한 잠재 벡터가 존재하는 바에도 생성기가 매우 유사한 샘플을 생성하는 등 지속적인 모드 붕괴 문제를 해결하기 위해.
- GAN 아키텍처를 수정하지 않고도 일반화 가능하고 아키텍처에 종속되지 않는 모듈을 개발하여 학습 안정성과 다양성을 향상시키기 위해.
- 픽셀 공간이 아닌 특징 공간에서 잠재 벡터 유사도와 생성된 이미지 특징 유사도 간의 일관성을 강제하기 위해.
- 더블업 작업, 예를 들어 데이터 증강 및 도메인 번역에 효과적으로 적용할 수 있도록 샘플 품질과 다양성을 향상시키기 위해.
제안 방법
- PDPM은 잠재 벡터의 정규화된 그램 행렬을 사용해 기준 유사도 분포를 설정하기 위해 유사도를 측정한다.
- 가짜 이미지에 대해 판별기로부터 특징 맵을 추출하고, 그 정규화된 그램 행렬을 계산하여 특징 수준의 유사도를 측정한다.
- 두 잠재 벡터가 비유사하다면, 해당하는 가짜 이미지의 특징도 비유사해야 하며, 이를 위반하는 경우 다양성 페널티를 적용한다.
- 페널티는 균형 계수 λ를 사용해 생성기 학습 중에 적용되며, 이 스칼라 외에 추가 파rameter가 없도록 설계되어 있다.
- 이 프레임워크는 플러그인 모듈로 설계되어 DCGAN, WGAN-GP, StarGAN과 같은 다양한 GAN 아키텍처와 호환된다.
- 특징 공간에서 작동하므로 픽셀 공간보다 더 견고하며, 다른 방법에서 관찰되는 노이즈가 있는 픽셀 생성 문제를 피할 수 있다.
실험 결과
연구 질문
- RQ1기본 아키텍처를 수정하지 않고도 GAN의 모드 붕괴 문제를 완화할 수 있는 일반 목적의 모듈을 설계할 수 있는가?
- RQ2잠재 벡터 유사도와 생성된 이미지 특징 유사도 간의 일관성을 강제하면 모드 커버리지와 샘플 다양성이 향상되는가?
- RQ3특징 기반 페널티 메커니즘이 기존의 손실 기반 또는 아키텍처 수정 방식보다 이미지 품질과 다양성 측면에서 뛰어나게 작용하는가?
- RQ4제안된 모듈은 데이터 증강 및 도메인 번역과 같은 더블업 작업에서 얼마나 효과적인가?
- RQ5PDPM 모듈은 다양한 GAN 아키텍처와 데이터셋에서 성능을 유지하는가?
주요 결과
- DCGAN을 사용할 경우 CelebA에서 FID 점수 21.76을 기록해 기존의 바닐라 GAN 및 다른 SOTA 방법보다 뚜렷이 뛰어난 성능을 보였다. WGAN-GP를 사용할 경우 FID 점수는 24.18을 기록했다.
- 2D 합성 데이터셋에서 바닐라 GAN 대비 PDPM이 네 개 더 많은 모드를 포괄하여 뛰어난 모드 커버리지 성능을 입증했다.
- 이미지 데이터 증강 작업에서, PDPM은 WGAN-GP 대비 MNIST에서 0.24% 향상된 정확도, Fashion-MNIST에서 1.33% 향상, CIFAR-10에서 0.55% 향상된 성능을 기록했다.
- 잠재 공간 내 선형 보간 결과, PDPM이 생성한 전이 과정은 노이즈가 없는 픽셀을 가지며 매끄럽게 유지되었고, MS 정규화 그룹과는 달리 뚜렷한 노이즈가 없었다.
- 도메인 번역 작업에서 PDPM은 더 빠른 수렴과 더 정확한 주의 맵을 제공하여 바닐라 StarGAN보다 뛰어난 성능을 보였다.
- 이 PDPM 모듈은 이미지 생성, 데이터 증강, 도메인 번역 등 다양한 작업에서 높은 성능을 기록하며 강력한 전이 가능성과 낮은 계산 비용을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.