Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Image-to-Image Translation Using Domain-Specific Variational Information Bound

Hadi Kazemi, Sobhan Soleymani|arXiv (Cornell University)|2018. 11. 29.
Image Processing Techniques and Applications인용 수 20
한 줄 요약

이 논문은 도메인별 변동 정보에 기반한 도메인 특이적 변동 정보 바ounds를 사용하여 도메인 불변 및 도메인 특이적 표현을 분리하는 비지도 이미지 간 번역 프레임워크를 제안한다. 공유된 콘텐츠와 모odal 특이적 특징을 위한 별도의 코드를 학습함으로써, 쌍화된 데이터 없이도 일대다 번역을 가능하게 하며, 샘플링 또는 참조 기반 생성을 통해 다양하고 현실적인 출력을 달성한다.

ABSTRACT

Unsupervised image-to-image translation is a class of computer vision problems which aims at modeling conditional distribution of images in the target domain, given a set of unpaired images in the source and target domains. An image in the source domain might have multiple representations in the target domain. Therefore, ambiguity in modeling of the conditional distribution arises, specially when the images in the source and target domains come from different modalities. Current approaches mostly rely on simplifying assumptions to map both domains into a shared-latent space. Consequently, they are only able to model the domain-invariant information between the two modalities. These approaches usually fail to model domain-specific information which has no representation in the target domain. In this work, we propose an unsupervised image-to-image translation framework which maximizes a domain-specific variational information bound and learns the target domain-invariant representation of the two domain. The proposed framework makes it possible to map a single source image into multiple images in the target domain, utilizing several target domain-specific codes sampled randomly from the prior distribution, or extracted from reference images.

연구 동기 및 목표

  • 도메인이 크게 다를 경우 공유 잠재 공간 모델이 모달 특이 정보를 포착하지 못하는 한계를 해결하기 위해.
  • 도메인 불변 콘텐츠와 도메인 특이적 특징의 분리된 표현을 학습하여 일대다 번역을 가능하게 하기 위해.
  • 도메인 특이적 변동 정보 바ounds를 최대화하여 비지도 번역에서 다양성과 현실성을 향상시키기 위해.
  • 번역된 이미지에 도메인 특이적 특징이 포함되는 사이클 일致성에 기인한 인코딩 문제를 해결하기 위해.

제안 방법

  • 프레임워크는 원본 이미지에서 도메인 불변 코드와 도메인 특이적 코드를 추출하기 위해 두 개의 인코더를 사용한다.
  • 생성자는 도메인 불변 코드와 단위 정규 분포에서 샘플링한 타겟 도메인 특이적 코드 또는 참조 이미지에서 추출한 코드를 사용하여 타겟 도메인 이미지를 합성한다.
  • 원본 도메인 특이적 코드와 원본 이미지 간의 상호정보 최대화를 통해 도메인 특이적 특징의 의미 있는 분리가 이루어지도록 보장한다.
  • 원본 도메인 특이적 코드와 번역된 타겟 이미지 간의 상호정보 최소화를 통해 도메인 특이적 특징이 타겟에 인코딩되지 않도록 방지하여 사이클 일치성 아티팩트를 줄인다.
  • 도메인 불변 및 도메인 특이적 코드에 대한 복원 경로를 통해 사이클 일치성을 강제로 구현함으로써 구조적 및 의미적 정합성을 보장한다.
  • 손실 함수에는 도메인 특이적 변동 정보 바ounds가 포함되어 있어, 모델이 해석 가능하고 분리된 모달 특이 콘텐츠 표현을 학습하도록 유도한다.

실험 결과

연구 질문

  • RQ1도메인 불변 및 도메인 특이적 특징의 분리된 표현이 비지도 환경에서 일대다 이미지 번역을 향상시키는가?
  • RQ2쌍화된 데이터 없이 도메인 특이적 변동 정보 바ounds를 최대화하면 다양성과 현실성은 어떻게 향상되는가?
  • RQ3도메인 특이적 및 도메인 불변 코드를 분리함으로써 원본 특이적 특징이 번역된 이미지에 얼마나 줄어들게 되는가?
  • RQ4제안된 방법이 도메인이 크게 다른 교차 모달 번역 작업에서 CycleGAN 및 UNIT과 같은 사이클 일치 모델을 능가하는가?
  • RQ5사전에서 샘플링하거나 참조 이미지를 사용하면 타겟 도메인의 생성 출력 다양성을 효과적으로 제어할 수 있는가?

주요 결과

  • 제안된 프레임워크는 도메인 특이적 코드의 사이클 일치성을 유지할 경우, 신발에 대해 LPIPS 점수 0.121, 핸드백에 대해 0.129를 기록하여, 다양성 측면에서 분리된 버전(0.095 및 0.113)보다 유의미하게 뛰어나다.
  • 모델은 FID 점수에서 CycleGAN 및 UNIT보다 낮아 실제 데이터와의 분포 일치도가 뛰어나, 이미지 품질과 현실성이 향상되었음을 확인한다.
  • 도메인 특이적 코드의 사이클 일치성이 없을 경우, LPIPS 점수 하락으로 인해 모드 붕괴 현상이 발생함을 보여주며, 출력 다양성이 감소함을 시사한다.
  • 제거 실험을 통해 도메인 불변 코드의 사이클 일치성 제거 시 이미지 품질이 열악해지며, 이는 불변 코드가 도메인 특이적 정보를 수반하게 되기 때문임을 확인한다.
  • 인간 평가에서 높은 속임수 비율을 유지함으로써 생성된 이미지가 시각적으로 현실적이며 실제 이미지와 구별되지 않음을 확인한다.
  • 쌍화된 데이터나 감독 없이도 다양한 도메인 간에 다양하고 현실적인 번역을 성공적으로 생성할 수 있다 (예: 에지에서 신발, 에지에서 핸드백으로의 변환).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.