Skip to main content
QUICK REVIEW

[논문 리뷰] AlignGAN: Learning to Align Cross-Domain Images with Conditional Generative Adversarial Networks

Xudong Mao, Qing Li|arXiv (Cornell University)|2017. 07. 05.
Generative Adversarial Networks and Image Synthesis참고 문헌 19인용 수 14
한 줄 요약

이 논문은 쌍이 없는 훈련 데이터를 사용하여 교차 도메인 이미지를 정렬하는 조건부 GAN 기반 모델인 AlignGAN을 제안한다. 이는 생성기와 판별기의 특정 레이어에 도메인 벡터를 전략적으로 조건화하여 구현된다. 이 방법은 도메인 특화된 의미와 공유되는 의미를 분리하여 학습함으로써 다양한 도메인 간 고화질 이미지 정렬을 가능하게 하며, 도메인 및 레이블 벡터에 대한 다중 조건화를 통해 레이블 전파도 가능하게 한다.

ABSTRACT

Recently, several methods based on generative adversarial network (GAN) have been proposed for the task of aligning cross-domain images or learning a joint distribution of cross-domain images. One of the methods is to use conditional GAN for alignment. However, previous attempts of adopting conditional GAN do not perform as well as other methods. In this work we present an approach for improving the capability of the methods which are based on conditional GAN. We evaluate the proposed method on numerous tasks and the experimental results show that it is able to align the cross-domain images successfully in absence of paired samples. Furthermore, we also propose another model which conditions on multiple information such as domain information and label information. Conditioning on domain information and label information, we are able to conduct label propagation from the source domain to the target domain. A 2-step alternating training algorithm is proposed to learn this model.

연구 동기 및 목표

  • 쌍이 없는 훈련 샘플이 존재하는 교차 도메인 이미지 정렬 문제를 해결하는 것 — 이는 이전 방법의 한계를 초래한다.
  • 도메인 벡터가 조건화되는 위치를 최적화하여 조건부 GAN의 교차 도메인 이미지 정렬 성능을 향상시키는 것.
  • 도메인 및 레이블 정보에 대한 동시 조건화를 통해 소스 도메인에서 타겟 도메인으로 레이블 전파를 가능하게 하는 것.
  • 기본적으로 학습이 어려운 다중 조건화 모델을 안정적으로 훈련시킬 수 있는 전략을 개발하는 것.
  • 도메인 벡터 차원을 늘림으로써 두 개 초과의 도메인으로의 일반화 성능을 입증하는 것.

제안 방법

  • 판별기의 이미지 입력 레이어에 도메인 벡터를 조건화하여 도메인 신호를 강화하면서, 생성기의 노이즈 입력 레이어에는 조건화를 피함으로써 공유 의미를 유지한다.
  • 도메인 및 레이블 벡터를 함께 최적화하기 위해 이중 단계의 교차 훈련 알고리즘을 사용한다.
  • 도메인 벡터를 사용한 조건부 GAN 손실을 적용하여 생성기가 도메인에 맞는 이미지를 생성하도록 유도하면서도 콘텐츠 의미를 유지한다.
  • 도메인 특화 및 공유 특징의 분리된 표현을 활용하여 레이블 벡터를 통해 생성된 이미지의 클래스를 제어할 수 있도록 한다.
  • 대부분의 작업에서 훈련 안정성과 이미지 품질 향상을 위해 LSGAN 손실을 사용하며, 숫자와 부정적 숫자 간의 작업과 같은 특정 작업에는 표준 GAN을 사용한다.
  • 도메인 벡터의 차원을 늘림으로써 모델을 세 개 이상의 도메인으로 확장한다.

실험 결과

연구 질문

  • RQ1쌍이 없는 데이터가 존재할 때 조건부 GAN이 교차 도메인 이미지 정렬에 효과적으로 적용될 수 있는가?
  • RQ2네트워크 아키텍처에서 도메인 벡터의 조건화 위치가 정렬 성능에 미치는 영향은 어떠한가?
  • RQ3도메인 및 레이블 정보에 대한 동시 조건화가 소스 도메인에서 타겟 도메인으로 효과적인 레이블 전파를 가능하게 하는가?
  • RQ4기본적으로 학습이 어려운 다중 조건화 GAN을 안정적으로 최적화할 수 있는 훈련 전략은 무엇인가?
  • RQ5AlignGAN은 두 개 초과의 도메인과 다양한 이미지 번역 작업으로까지 일반화될 수 있는가?

주요 결과

  • AlignGAN은 쌍이 없는 샘플이 없는 상황에서도 여러 작업 — 예를 들어 숫자 대 부정적 숫자, 밝은 머리카락 대 검은 머리카락, 의자 대 자동차 — 에서 교차 도메인 이미지를 성공적으로 정렬한다.
  • 생성된 서로 다른 도메인의 이미지 간 상관관계가 높으며, 예를 들어 의자와 자동차 이미지 생성에서 같은 회전 각도를 일치시킨다.
  • 도메인 및 레이블 벡터에 대한 동시 조건화를 통해 타겟 도메인에서 생성된 이미지의 클래스 레이블 제어가 효과적으로 가능해진다.
  • 이중 단계의 교차 훈련 알고리즘이 다중 조건화 모델의 안정적인 훈련을 가능하게 하여 직접적인 공동 훈련에서 발생하는 수렴 문제를 해결한다.
  • LSGAN 손실은 대부분의 작업에서 이미지 품질과 훈련 안정성을 향상시키지만, 숫자와 부정적 숫자 간의 작업에서는 표준 GAN이 더 우수한 성능을 보인다.
  • 도메인 벡터의 차원을 늘림으로써 모델 아키텍처에서와 같이 세 개 이상의 도메인으로의 일반화가 가능함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.