Skip to main content
QUICK REVIEW

[논문 리뷰] Dual Generator Generative Adversarial Networks for Multi-Domain Image-to-Image Translation

Hao Tang, Dan Xu|arXiv (Cornell University)|2019. 01. 14.
Advanced Image Processing Techniques참고 문헌 49인용 수 4
한 줄 요약

이 논문은 단일 모델을 사용하여 확장 가능하고 다중 도메인의 쌍이 없는 이미지 간 번역을 위한 G2GAN이라는 이중 생성기 GAN 프레임워크를 제안한다. 기존의 방법이 각 도메인 쌍에 대해 복수의 모델을 필요로 하거나 번역과 복원에 하나의 생성기를 공유하는 데 반해, G2GAN은 작업별로 특화된 생성기(번역 및 복원)를 사용하며, 태스크에 맞는 유연한 파라미터 공유를 통해 색상 사이클 일관성, SSIM, 정체성 손실과 함께 공동 최적화를 실현함으로써 이미지 품질과 안정성 면에서 우수한 성능을 달성한다. 이는 얼굴, 경관, 건물 등 6개 데이터셋에서 최신 기술을 초월한다.

ABSTRACT

State-of-the-art methods for image-to-image translation with Generative Adversarial Networks (GANs) can learn a mapping from one domain to another domain using unpaired image data. However, these methods require the training of one specific model for every pair of image domains, which limits the scalability in dealing with more than two image domains. In addition, the training stage of these methods has the common problem of model collapse that degrades the quality of the generated images. To tackle these issues, we propose a Dual Generator Generative Adversarial Network (G$^2$GAN), which is a robust and scalable approach allowing to perform unpaired image-to-image translation for multiple domains using only dual generators within a single model. Moreover, we explore different optimization losses for better training of G$^2$GAN, and thus make unpaired image-to-image translation with higher consistency and better stability. Extensive experiments on six publicly available datasets with different scenarios, i.e., architectural buildings, seasons, landscape and human faces, demonstrate that the proposed G$^2$GAN achieves superior model capacity and better generation performance comparing with existing image-to-image translation GAN models.

연구 동기 및 목표

  • 기존의 쌍이 없는 이미지 간 번역 방법에서 각 도메인 쌍에 대해 복수의 모델을 훈련이 필요로 하는 확장성 문제와 모델 붕괴 문제를 해결하기 위해.
  • 번역과 복원 작업을 하나의 생성기를 공유하는 대신, 두 개의 전용 생성기를 사용하여 번역과 복원을 분리함으로써 훈련 안정성과 생성 품질을 향상시키기 위해.
  • 큰 수의 도메인이 존재하더라도 모델 수를 Θ(m²)에서 단 하나로 줄여 효율적인 다중 도메인 번역을 가능하게 하기 위해.
  • 색상 사이클 일관성, 다중 척도 SSIM, 정체성 손실 등 다양한 최적화 손실을 탐색하고 통합하여 훈련 안정성과 이미지 충실도를 향상시키기 위해.

제안 방법

  • G2GAN은 두 가지 다른 생성기를 사용한다: 도메인 X의 이미지를 목표 도메인 Y로 매핑하는 번역 생성기 Gᵗ와, 생성된 이미지를 원래 도메인 X로 다시 매핑하는 복원 생성기 Gʳ이며, 각각 목표 도메인 레이블 zᵧ 및 원래 레이블 zₓ를 사용한다.
  • 두 생성기는 공유 판별기와 함께 공동으로 훈련되어, 적대적 훈련을 가능하게 하면서도 작업별 네트워크 아키텍처와 파라미터 공유 수준을 유지한다.
  • 색상 사이클 일관성 손실이 도입되어 번역 및 복원 경로에서 색상 분포를 유지함으로써 시각적 충실도를 향상시킨다.
  • 다중 척도 SSIM과 정체성 손실이 통합되어 구조적 일관성 향상과 정체성 특징 보존이 가능해지며, 특히 얼굴 번역 작업에서 유용하다.
  • 모델은 완전 공유, 부분 공유, 또는 공유 없음 등의 다양한 파라미터 공유 전략을 지원하여 모델 용량과 성능 간의 트레이드오프를 가능하게 한다.
  • 적대적 손실, 사이클 일관성 손실, 인지적 손실을 포함하는 공동 최적화 목표를 사용하여 엔드 투 엔드로 훈련함으로써 훈련 안정성 향상과 모드 붕괴 완화를 달성한다.

실험 결과

연구 질문

  • RQ1이중 생성기를 가진 단일 모델 아키텍처가 기존의 다중 모델 또는 공유 생성기 접근 방식보다 다중 도메인 이미지 간 번역에서 우수한 성능을 내는가?
  • RQ2StarGAN과 같은 공유 생성기 모델과 비교해 번역과 복원을 별도의 생성기로 분리함으로써 훈련 안정성과 생성 품질이 향상되는가?
  • RQ3색상 사이클 일관성, SSIM, 정체성 손실과 같은 다양한 최적화 손실이 G2GAN 프레임워크의 성능과 안정성에 미치는 영향은 무엇인가?
  • RQ4두 생성기 간의 파라미터 공유 수준을 다양하게 조절할 경우 모델 용량과 생성 품질에 어떤 영향을 미치는가?
  • RQ5G2GAN은 얼굴, 경관, 건축물 등 다양한 도메인에서 단일 통합 모델로 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • G2GAN은 Facades, AR, Bu3dfe 데이터셋에서 최고의 FID 점수를 기록했으며, 레이블-사진 번역과 사진-레이블 번역에 각각 23.6%와 55.625%의 트러커 정확도를 기록하여 StarGAN 및 기타 베이스라인을 능가했다.
  • 제거 실험에서 정체성 손실을 제거한 경우(All - I) 성능이 각각 2.6%와 4.2%로 떨어져, 정체성 보존에 있어 정체성 손실의 중요성을 입증했다.
  • 이중 판별기 버전(All - D)은 각각 9.0%와 5.3%의 트러커 정확도를 기록하여 전체 모델 대비 안정성 향상을 보였지만, 다른 손실과 조합할 경우 성능 저하가 발생했다.
  • G2GAN은 CycleGAN(52.6M×21), DualGAN(178.7M×21), StarGAN(53.2M×1)보다 훨씬 적은 파라미터(53.2M–61.6M)를 사용하면서도 더 나은 또는 유사한 성능을 달성했다.
  • 전체 G2GAN 모델은 레이블-사진 번역에서 10.3%의 트러커 정확도, AR 데이터셋에서는 22.8%의 정확도를 기록하여 다양한 도메인에서 강력한 성능을 보였다.
  • 파라미터 공유가 없는 모델(G2GAN no-sharing)은 61.6M 파라미터와 AR 데이터셋에서 2.1%의 트러커 정확도를 기록했으며, 이는 파라미터 공유가 성능 향상에 필수적임을 시사하지만, 여전히 경쟁력 있는 성능을 유지함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.