Skip to main content
QUICK REVIEW

[논문 리뷰] MIXGAN: Learning Concepts from Different Domains for Mixture Generation

Guang-Yuan Hao, Hong-Xing Yu|arXiv (Cornell University)|2018. 07. 04.
Generative Adversarial Networks and Image Synthesis참고 문헌 27인용 수 3
한 줄 요약

MIXGAN은 한 도메인에서 콘텐츠 개념을 학습하고 다른 도메인에서 스타일 개념을 학습함으로써, 이러한 서로 다른 개념을 융합하여 새로운 도메인의 이미지를 합성하는 데에 효과적인 새로운 생성적 적대적 네트워크를 제안한다. 계층적 콘텐츠 디코더와 스타일 임bedded 믹스처 디코더를 사용함으로써 MIXGAN은 믹스처 생성에서 뛰어난 성능을 달성하였으며, 인간 평가 결과 70%의 성공률을 기록하였다. 이는 AAE, LSGAN, CycleGAN와 비교해 유의미하게 높은 성능이며, 이들 모델은 10% 이하의 점수를 기록하였다.

ABSTRACT

In this work, we present an interesting attempt on mixture generation: absorbing different image concepts (e.g., content and style) from different domains and thus generating a new domain with learned concepts. In particular, we propose a mixture generative adversarial network (MIXGAN). MIXGAN learns concepts of content and style from two domains respectively, and thus can join them for mixture generation in a new domain, i.e., generating images with content from one domain and style from another. MIXGAN overcomes the limitation of current GAN-based models which either generate new images in the same domain as they observed in training stage, or require off-the-shelf content templates for transferring or translation. Extensive experimental results demonstrate the effectiveness of MIXGAN as compared to related state-of-the-art GAN-based models.

연구 동기 및 목표

  • 기존 GAN 모델이 훈련 데이터와 동일한 도메인 내에서만 이미지를 생성하는 데에 한계가 있다는 문제를 해결하기 위해.
  • 스타일 전이 및 이미지 간 번역 모델에서 사전에 존재하는 콘텐츠 템플릿이 필요로 하는 문제를 해결하기 위해.
  • 한 도메인의 콘텐츠와 다른 도메인의 스타일을 조합하여 새로운 하이브리드 도메인의 이미지를 생성할 수 있도록 하기 위해.
  • 창의적 이미지 합성에 적합한, 콘텐츠와 스타일이라는 서로 다른 개념을 각기 다른 도메인에서 명시적으로 학습하고 융합하는 프레임워크를 개발하기 위해.

제안 방법

  • MIXGAN은 콘텐츠 도메인(예: 가방의 형태)에서 계층적 특징을 추출하는 콘텐츠 디코더를 갖춘 믹스처 생성자 사용.
  • 믹스처 디코더는 스타일 도메인(예: 신발의 색상 패턴)에서 스타일 개념을 학습하며, 콘텐츠 특징에 점진적으로 스타일을 통합하도록 설계됨.
  • 생성 과정을 시작하기 위해 노이즈를 잠재 코드로 사용하며, 요리하기 전 재료를 준비하는 것과 유사함.
  • 생성자와 판별자 간의 조건부 적대적 훈련 방식을 사용하여 실제 이미지와 생성된 이미지를 구분하도록 하여 현실적인 출력을 유도함.
  • 생성된 샘플을 가장 가까운 훈련 분포에 할당하기 위해 심층 이진 분류기를 사용하여 MMD 기반 평가 수행.
  • 콘텐츠 및 스타일의 충실도를 유지하기 위해 적대적 손실과 재구성 손실을 사용하여 엔드 투 엔드로 프레임워크를 훈련함.

실험 결과

연구 질문

  • RQ1기존 콘텐츠 템플릿이 없는 조건에서, GAN 기반 모델이 두 도메인의 콘텐츠와 스타일을 조합하여 이미지를 생성할 수 있는가?
  • RQ2콘텐츠와 스타일 개념은 어떻게 서로 다른 도메인에서 분리하여 공동으로 학습할 수 있으며, 효과적인 믹스처 생성을 위해 어떻게 활용할 수 있는가?
  • RQ3모델이 두 훈련 분포와는 다를 새로운 도메인에 속하는 샘플을 생성할 수 있는가? 이를 분포 분석을 통해 입증할 수 있는가?
  • RQ4인간 평가 및 MMD 거리 측정을 통해 기존 GAN 모델에 비해 얼마나 뛰어난 성능을 보일 수 있는가?

주요 결과

  • MIXGAN은 두 도메인의 콘텐츠와 스타일을 융합한 이미지를 생성하는 데 있어 인간 평가 성공률이 70% 이상을 기록하였으며, 이는 AAE, LSGAN, CycleGAN와 비교해 유의미하게 높은 성능이다. 이들 모델은 10% 이하의 점수를 기록하였다.
  • t-SNE 시각화 결과, MIXGAN이 생성한 샘플이 두 훈련 분포 사이에 위치해 있음을 확인하였으며, 이는 성공적인 믹스처 생성을 의미한다.
  • 기존 모델 대비 MIXGAN은 생성된 샘플과 가장 가까운 훈련 데이터 세트 간의 MMD 거리가 더 높게 나타났으며, 이는 생성된 이미지가 훈련 데이터의 단순 복제가 아님을 시사한다.
  • 손글씨 숫자의 콘텐츠와 타입스크립트 숫자의 스타일을 융합하여 다채로운 숫자 이미지를 성공적으로 생성함으로써, 도메인 간 융합이 가능함을 입증하였다.
  • 가방과 신발을 다루는 작업에서 MIXGAN은 콘텐츠(가방의 형태)와 스타일(신발의 색상 패턴)이 시각적으로 조화를 이룬 일관성 있는 이미지를 생성하였다.
  • 제거 실험 결과, 믹스처 생성자 설계—콘텐츠와 스타일 학습을 분리하고 계층적 디코더를 통해 통합하는 방식—이 성능 향상에 필수적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.