Skip to main content
QUICK REVIEW

[논문 리뷰] UVCGAN v2: An Improved Cycle-Consistent GAN for Unpaired Image-to-Image Translation

D. Torbunov, Yi Huang|arXiv (Cornell University)|2023. 03. 28.
Generative Adversarial Networks and Image Synthesis인용 수 4
한 줄 요약

UVCGAN v2는 비쌍체 이미지 간 번역을 위한 현저히 향상된 사이클 일致 GAN을 제안하며, 비전 트랜스포머(ViT)와 스타일 조절형 컨볼루션 블록을 통합하고, 모드 붕괴를 방지하기 위해 디스criminator 설계를 개선하며, 최신 GAN 훈련 기법을 적용함으로써 성능을 향상시켰다. 이는 CelebA-HQ 남성에서 여성으로의 번역 작업에서 최신의 확산 모델보다 FID 점수를 40% 향상시켰으며, GAN 기반 및 확산 모델 기반 모델을 모두 능가했고, 기존의 표준 픽셀 단위 충실도 측정 기준의 타당성에 도전했다.

ABSTRACT

An unpaired image-to-image (I2I) translation technique seeks to find a mapping between two domains of data in a fully unsupervised manner. While initial solutions to the I2I problem were provided by generative adversarial neural networks (GANs), diffusion models (DMs) currently hold the state-of-the-art status on the I2I translation benchmarks in terms of Frechet inception distance (FID). Yet, DMs suffer from limitations, such as not using data from the source domain during the training or maintaining consistency of the source and translated images only via simple pixel-wise errors. This work improves a recent UVCGAN model and equips it with modern advancements in model architectures and training procedures. The resulting revised model significantly outperforms other advanced GAN- and DM-based competitors on a variety of benchmarks. In the case of Male-to-Female translation of CelebA, the model achieves more than 40% improvement in FID score compared to the state-of-the-art results. This work also demonstrates the ineffectiveness of the pixel-wise I2I translation faithfulness metrics and suggests their revision. The code and trained models are available at https://github.com/LS4GAN/uvcgan2

연구 동기 및 목표

  • 현재 비쌍체 이미지 간 번역 모델의 한계, 특히 소스 데이터의 비최적 사용과 확산 모델에서 단순한 픽셀 단위 일致성에 대한 의존성을 해결하기 위해.
  • 비쌍체 I2I 작업에 일반적으로 적용되지 않는 현대적 아키텍처 및 훈련 기법을 통합하여 사이클 일치 GAN의 성능을 향상시키기 위해.
  • 기존의 픽셀 단위 충실도 측정 기준의 타당성을 도전하고, 인지 기반의 대체 기준을 제안하기 위해.
  • CelebA, CelebA-HQ, AFHQ를 포함한 다양한 번역 벤치마크에서 최고 수준의 성능을 달성하기 위해.

제안 방법

  • 비전 트랜스포머(ViT)와 스타일 조절형 컨볼루션 블록을 융합한 하이브리드 신경망 아키텍처를 도입하여 특징 표현 및 스타일 전달을 향상시켰다.
  • 모드 붕괴를 완화하기 위해 특수 설계된 디스criminator 헤드를 도입하여 훈련 안정성과 다양성을 향상시켰다.
  • 프로그레시브 그로잉, 스펙트럴 정규화, 개선된 기울기 페널티와 같은 최신 GAN 훈련 기법을 비쌍체 I2I 환경에 적응하여 적용했다.
  • 구조적 일치성을 유지하기 위해 최적화된 하이퍼파ram터(λ_cyc=5, λ_GP=0.1, γ=100)를 사용한 사이클 일치 손실을 통합했다.
  • 적대적 훈련 이전에 생성자에 대해 자기지도 학습 전처리 단계를 도입하여 수렴성과 품질을 향상시켰다.
  • 인지 기반 대체 기준으로의 충실도 측정 기준을 재평가하고 재정의하여 단순한 L2 픽셀 단위 거리에서 벗어났다.
Figure 5 : Examples of face landmark distance (Lm- $L_{2}$ ) between an input and a translated image. ( Appendix D )
Figure 5 : Examples of face landmark distance (Lm- $L_{2}$ ) between an input and a translated image. ( Appendix D )

실험 결과

연구 질문

  • RQ1현대화된 사이클 일치 GAN 아키텍처가 비쌍체 이미지 간 번역에서 최신의 확산 모델을 능가할 수 있는가?
  • RQ2현대적 GAN 훈련 기법이 사이클 일치 I2I 모델의 성능과 안정성에 어떤 영향을 미치는가?
  • RQ3기존의 표준 픽셀 단위 일치성 측정 기준이 인간의 번역 충실도 인지에 얼마나 정확히 반영되는가?
  • RQ4ViT와 스타일 조절형 컨볼루션을 융합함으로써 번역 작업에서 이미지의 현실감과 의미 일致성을 향상시킬 수 있는가?
  • RQ5개선된 충실도 측정 기준이 인간 평가의 번역 품질과 더 잘 일치하는가?

주요 결과

  • UVCGAN v2는 CelebA-HQ 남성에서 여성으로의 번역 작업에서 최신의 확산 모델 EGSDE보다 Fréchet Inception Distance(FID) 점수를 40% 향상시켰다.
  • 동일한 CelebA 남성에서 여성으로의 벤치마크에서 원래 UVCGAN 대비 현실감이 50% 이상 향상되었다.
  • 픽셀 단위 일치성 손실(L2)은 상충 관계를 유도한다: λ_consist를 높일수록 픽셀 수준의 충실도는 향상되지만, 특히 고도화된 작업인 고양이에서 강아지로의 번역에서 이미지의 현실감이 크게 떨어진다.
  • 고양이에서 강아지로의 번역에서 λ_consist가 0.2를 초과하면 현실감이 극적으로 떨어지는 것을 확인하여, 데이터셋에 따라 민감도가 높다는 것을 입증했다.
  • 본 연구는 현재의 픽셀 단위 충실도 측정 기준이 인간의 인지와 일치하지 않음을 드러내며, 개선된 인지 기반 대체 기준을 제안했다.
  • 절단 분석 결과 최적의 하이퍼파ram터(λ_cyc=5, λ_GP=0.1, γ=100)가 CelebA-HQ와 AFHQ와 같은 고품질 데이터셋 간에 일관되게 유지됨을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.