Skip to main content
QUICK REVIEW

[논문 리뷰] XOGAN: One-to-Many Unsupervised Image-to-Image Translation

Yongqi Zhang|arXiv (Cornell University)|2018. 05. 18.
Generative Adversarial Networks and Image Synthesis참고 문헌 3인용 수 5
한 줄 요약

XOGAN은 'XO'-구조를 가진 조건부 생성 적대적 네트워크를 제안하여, 색상과 질감과 같은 다양한 이미지 변형을 제어할 수 있는 분리된 잠재 변수 Z를 도입함으로써, 한 장의 이미지에서 여러 장의 타겟 이미지로의 비지도 이미지 간 이미지 번역 문제를 해결한다. 이 모델은 에지에서 신발, 에지에서 핸드백, 그리고 CelebA 데이터셋에서의 고해상도이고 다양한 결과를 내는 이미지 번역을 가능하게 하며, 사이클 일관성과 도메인 적대적 훈련을 유지하여 높은 품질의 결과를 제공한다.

ABSTRACT

Unsupervised image-to-image translation aims at learning the relationship between samples from two image domains without supervised pair information. The relationship between two domain images can be one-to-one, one-to-many or many-to-many. In this paper, we study the one-to-many unsupervised image translation problem in which an input sample from one domain can correspond to multiple samples in the other domain. To learn the complex relationship between the two domains, we introduce an additional variable to control the variations in our one-to-many mapping. A generative model with an XO-structure, called the XOGAN, is proposed to learn the cross domain relationship among the two domains and the ad- ditional variables. Not only can we learn to translate between the two image domains, we can also handle the translated images with additional variations. Experiments are performed on unpaired image generation tasks, including edges-to-objects translation and facial image translation. We show that the proposed XOGAN model can generate plausible images and control variations, such as color and texture, of the generated images. Moreover, while state-of-the-art unpaired image generation algorithms tend to generate images with monotonous colors, XOGAN can generate more diverse results.

연구 동기 및 목표

  • 단일 소스 이미지가 여러 타겟 이미지로 매핑될 수 있는 한 대 다수 비지도 이미지 간 번역 문제에 대응하기 위해.
  • 쌍화된 훈련 데이터 없이도 복잡하고 다양한 이미지 변형, 예를 들어 색상과 질감을 모델링하기 위해.
  • 추가적인 잠재 변수 Z를 통해 콘텐츠와 속성 요소를 분리함으로써 제어 가능한 이미지 생성을 가능하게 하기 위해.
  • faithful한 도메인 간 번역과 현실적인 이미지 합성을 보장하기 위해 사이클 일관성과 도메인 적대적 훈련을 유지하기 위해.

제안 방법

  • 양방향 번역을 가능하게 하기 위해 두 개의 생성자 $G_A: \mathcal{B} \rightarrow \mathcal{A}$ 및 $G_B: (\mathcal{A}, Z) \rightarrow \mathcal{B}$ 를 포함한 'XO'-구조 GAN 아키텍처를 도입한다.
  • 생성된 이미지의 변형을 제어하기 위해 표준 정규분포에서 샘플링된 잠재 변수 $Z \sim \mathcal{N}(0, I)$ 를 사용한다.
  • 재구성된 이미지와 원본 이미지 간의 일관성을 강제하기 위해 사이클 일관성 손실을 적용한다.
  • 생성된 이미지 $\mathcal{B}$ 가 실제 이미지의 분포와 구분되지 않도록 하기 위해 도메인 적대적 손실을 구현한다.
  • 도메인 간 왕복 번역 시 콘텐츠를 유지하기 위해 아이덴티티 손실을 사용한다.
  • 실제 이미지와 생성된 이미지를 구분하는 판별자로, 현실적인 이미지 품질을 보장한다.

실험 결과

연구 질문

  • RQ1생성 모델은 쌍화된 훈련 데이터 없이도 한 입력에서 다양한 출력을 내는 한 대 다수 이미지 번역을 학습할 수 있는가?
  • RQ2분리된 잠재 변수는 비지도 번역에서 색상과 질감과 같은 특정 이미지 속성을 어떻게 제어할 수 있는가?
  • RQ3잠재 코드 Z 를 조작함으로써 속성 교체(예: 색상 교체)를 어느 정도 수행할 수 있는가?
  • RQ4사이클 일관성과 도메인 적대적 훈련의 조합이 쌍화되지 않은 번역에서 이미지의 해상도와 다양성을 향상시키는가?
  • RQ5에지에서 신발, 에지에서 핸드백, 그리고 얼굴 속성 편집과 같은 다양한 이미지 번역 작업으로 일반화될 수 있는가?

주요 결과

  • XOGAN 모델은 에지에서 신발, 또는 신발에서 에지로의 양방향 번역에서 일관된 형태와 다양한 색상으로 고해상도이고 다양한 이미지를 성공적으로 생성한다.
  • 잠재 코드 $Z$ 는 색상과 같은 이미지 속성을 효과적으로 인코딩하여, Z 를 교환함으로써 한 이미지의 색상을 다른 이미지의 색상으로 교체할 수 있다.
  • 동일한 $Z$ 를 다양한 에지 입력에 적용할 경우, 일관된 색상을 가진 객체가 생성되며, 이는 제어 가능성의 증거가 된다.
  • 모델은 단조로운 색상 출력을 피하면서도 최신의 비쌍화 번역 방법보다 더 다양한 결과를 생성함으로써 뛰어난 성능을 보인다.
  • 사이클 일관성과 도메인 적대적 손실이 함께 작용하여 현실적인 이미지 생성과 충실한 도메인 매핑을 보장한다.
  • edges2shoes, edges2handbags, 그리고 CelebA에서의 실험을 통해 Z 는 의미 있고 분리되어 있음을 입증하였으며, 속성 전이와 시각적 일관성으로 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.