Skip to main content
QUICK REVIEW

[논문 리뷰] MISO: Mutual Information Loss with Stochastic Style Representations for Multimodal Image-to-Image Translation

Sanghyeon Na, Seungjoo Yoo|arXiv (Cornell University)|2019. 02. 11.
Generative Adversarial Networks and Image Synthesis참고 문헌 27인용 수 11
한 줄 요약

이 논문은 잠재 변수를 난수 변수로 모델링하고 분포 일致성을 강제함으로써 상태 기반의 다중 모odal 이미지 간 번역 성능을 향상시키기 위해 MISO를 제안한다. MISO는 스타일 표현에 기반한 콘텐츠 특징 조건화와 상호정보 기반의 확률적 손실 함수인 MILO를 도입함으로써 이미지 품질과 다양성을 향상시킨다. MISO는 잠재 변수를 난수 변수로 모델링하고 분포 일치를 강제함으로써 다양한 데이터셋에서 최고의 성능을 달성한다.

ABSTRACT

Unpaired multimodal image-to-image translation is a task of translating a given image in a source domain into diverse images in the target domain, overcoming the limitation of one-to-one mapping. Existing multimodal translation models are mainly based on the disentangled representations with an image reconstruction loss. We propose two approaches to improve multimodal translation quality. First, we use a content representation from the source domain conditioned on a style representation from the target domain. Second, rather than using a typical image reconstruction loss, we design MILO (Mutual Information LOss), a new stochastically-defined loss function based on information theory. This loss function directly reflects the interpretation of latent variables as a random variable. We show that our proposed model Mutual Information with StOchastic Style Representation(MISO) achieves state-of-the-art performance through extensive experiments on various real-world datasets.

연구 동기 및 목표

  • 기존의 비쌍체 다중 모달 이미지 간 번역 모델이 결정론적 재구성 손실과 독립적인 콘텐츠-스타일 분리에 의존하는 한계를 해결하기 위해.
  • 콘텐츠를 기본으로 하고 스타일을 조건부 수정자로 삼는 계층적 관계를 모델링하여 번역의 이미지 품질과 다양성을 향상시키기 위해.
  • 잠재 변수를 난수 변수로 간주하는 정보 이론적 손실 함수를 도입하여 기존의 L1 기반 자기 재구성 손실을 대체하기 위해.
  • 실제성 손실 없이 콘텐츠 보존과 더 높은 다양성을 달성하기 위해.

제안 방법

  • 목표 도메인의 스타일 특징에 기반하여 소스 이미지에서 콘텐츠 특징을 생성하는 조건부 인코더를 도입한다.
  • 기존의 L1 기반 자기 재구성 손실을 대체하기 위해 잠재 변수와 재구성된 이미지 간의 상호정보에 기반한 확률적 손실 함수인 MILO(Mutual Information Loss)를 제안한다.
  • BicycleGAN과 유사한 이중 단계 훈련 방식(IFI 및 FIF)을 사용하지만, 조건부 콘텐츠 표현과 MILO 손실을 도입하여 분리도 및 다양성을 향상시킨다.
  • 잠재 변수를 𝒩(0, I)로 분포하는 난수 변수로 모델링함으로써 분포 일치를 통해 일반화 및 다양성 향상을 가능하게 한다.
  • 손실 함수 내에서 상호정보를 추정하기 위해 변동형 정보 최대화(Variational Information Maximization)를 사용하여 안정적인 기울기와 함께 엔드 투 엔드 훈련을 가능하게 한다.
  • 기존의 자기 재구성 손실을 MILO로 대체하여 모델이 의미 있는, 다양한, 현실적인 이미지 분포를 학습하도록 유도한다.

실험 결과

연구 질문

  • RQ1콘텐츠 특징을 스타일 표현에 기반하여 조건화하는 것이 독립적인 분리와 비교해 다중 모달 이미지 번역의 품질과 다양성 향상에 기여하는가?
  • RQ2잠재 변수를 결정론적 값이 아닌 난수 변수로 모델링하는 것이 이미지 생성의 일반화 및 다양성 향상에 기여하는가?
  • RQ3상호정보 기반의 손실 함수(MILO)가 비쌍체 다중 모달 번역에서 기존 자기 재구성 손실을 능가하는가?
  • RQ4edges2shoes, cityscapes, monstercat와 같은 다양한 데이터셋에서 제안된 모델이 콘텐츠 보존 및 다양성 측면에서 어떻게 비교되는가?
  • RQ5계층적 콘텐츠-스타일 관계가 얼굴 및 예술적 이미지 번역에서 잡음과 잔상 감소 및 현실감 향상에 얼마나 기여하는가?

주요 결과

  • MISO는 edges2shoes, cityscapes, monstercat 등 다양한 데이터셋에서 최고의 성능을 기록하였으며, 가장 높은 다양성 및 현실감 점수를 확보하였다.
  • monstercat 데이터셋에서 MISO는 상한선 하에서 O↔O 다양성 점수 0.98을 기록하였으며, MUNIT(0.92)와 SRSO(0.90)를 크게 앞서며, I↔O 거리 0.41을 유지하였다.
  • 성별 번역(male↔female)에서 MISO는 양방향 모두에서 1% 이내의 오차율을 기록하였으며, DRIT 및 MUNIT가 여성→남성 번역에서 높은 실패율을 보이는 것과 대비하여 뛰어난 성능을 보였다.
  • 정성적 결과에서는 MISO가 나뭇가지의 구조, 지면의 질감, 헤어 스타일 및 메이크업 등의 세부 사항을 유지하면서도 다양한 현실적인 출력을 생성하는 것으로 나타났다.
  • MILO 손실을 사용하는 모델(MISO)은 SR 손실을 사용하는 SRSO보다 선명함과 다양성 측면에서 뛰어나며, 특히 헤어와 얼굴 세부 사항에서 우수한 성능을 보여 확률적 손실의 우수성을 입증하였다.
  • 잠재 공간 시각화 결과 MISO가 의미 있는 분리된 잘 정렬된 분포를 학습하고 있으며, 기억 현상은 피하고 미리 보지 않은 잠재 코드에 대한 일반화가 가능함을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.