Skip to main content
QUICK REVIEW

[논문 리뷰] ZstGAN: An Adversarial Approach for Unsupervised Zero-Shot Image-to-Image Translation

Jianxin Lin, Yingce Xia|arXiv (Cornell University)|2019. 06. 01.
Cancer-related molecular mechanisms research참고 문헌 37인용 수 8
한 줄 요약

이 논문은 비지도 학습을 통한 비지도 영상 간 번역(unsupervised zero-shot image-to-image translation, UZSIT)을 위한 생성 적대 기반 네트워크인 ZstGAN을 소개한다. 이는 훈련 데이터에 쌍이 없는 경우에도 알려지지 않은 영상 도메인 간 번역을 가능하게 한다. 시각적 특징과 속성 인코더를 통해 도메인별 특징을 모델링하고, 도메인에 영향을 받지 않는 특징을 분리함으로써, CUB 및 FLO 데이터셋에서 최신 기술을 초월하는 성능을 달성하며, FLO 데이터셋에서 알려지지 않은 도메인에서 정확도(top-1 accuracy)가 34.06%에 이른다.

ABSTRACT

Image-to-image translation models have shown remarkable ability on transferring images among different domains. Most of existing work follows the setting that the source domain and target domain keep the same at training and inference phases, which cannot be generalized to the scenarios for translating an image from an unseen domain to another unseen domain. In this work, we propose the Unsupervised Zero-Shot Image-to-image Translation (UZSIT) problem, which aims to learn a model that can translate samples from image domains that are not observed during training. Accordingly, we propose a framework called ZstGAN: By introducing an adversarial training scheme, ZstGAN learns to model each domain with domain-specific feature distribution that is semantically consistent on vision and attribute modalities. Then the domain-invariant features are disentangled with an shared encoder for image generation. We carry out extensive experiments on CUB and FLO datasets, and the results demonstrate the effectiveness of proposed method on UZSIT task. Moreover, ZstGAN shows significant accuracy improvements over state-of-the-art zero-shot learning methods on CUB and FLO.

연구 동기 및 목표

  • 추론 시 알려지지 않은 도메인으로 일반화할 수 없는 기존 영상 간 번역 모델의 한계를 해결한다.
  • 비지도 영상 간 번역(unsupervised zero-shot image-to-image translation, UZSIT)이라는 새로운 문제 설정을 제안한다. 이는 훈련 중에 쌍이 없는 데이터만 존재하고, 타겟 도메인이 알려지지 않은 상태에서 이루어진다.
  • 시각적 및 속성 모odal 간의 의미 일관성을 활용하여, 알려지지 않은 도메인으로 일반화할 수 있는 프레임워크를 개발한다.
  • 소스 도메인과 타겟 도메인 간 레이블링 또는 쌍이 없는 데이터가 필요 없이 영상 간 번역을 가능하게 한다.
  • 도메인에 영향을 받지 않는 특징과 도메인별 특징을 분리하여, 영상 번역의 유연성과 일반화 능력을 향상시킨다.

제안 방법

  • 시각적 입력을 위한 시각-세マン틱 인코더와 텍스트 기반 설명을 위한 속성-세맨틱 인코더를 포함한 이중 인코더 아키텍처를 도입하며, 도메인별 특징 분포를 공동으로 학습한다.
  • 도메인별 판별기와 함께 적대적 훈련을 사용하여 생성된 특징이 실제 도메인별 특징과 구분되지 않도록 보장한다.
  • 입력 영상에서 도메인에 영향을 받지 않는 특징을 추출하기 위해 공통 인코더를 구현하며, 이 특징은 도메인별 특징과 결합되어 영상 생성에 사용된다.
  • 다양한 손실 구성 요소를 적용한다: 시각적 및 속성 특징에 대한 분류 손실, 도메인별 및 공통 특징에 대한 적대적 손실, 사이클 일관성에 대한 복원 손실, 특징 간 일치를 위한 상호정보 최대화.
  • 이미지 또는 텍스트에서 도메인별 특징을 보간하여 알려지지 않은 도메인 간 연속적인 전이를 생성함으로써, 이산적인 도메인 레이블을 초월한 일반화 능력을 입증한다.
  • 완전히 비지도 방식으로 모델을 훈련하며, 알려진 도메인의 쌍이 없는 데이터와 알려지지 않은 도메인의 속성 기술만을 기반으로 한다.

실험 결과

연구 질문

  • RQ1생성 모델은 훈련 중에 보지 못한 도메인에 대해 쌍이 없는 데이터만으로도 영상 간 번역을 일반화할 수 있는가?
  • RQ2영역별 특징과 도메인에 영향을 받지 않는 특징을 효과적으로 분리하여 영상 간 번역을 가능하게 할 수 있는가?
  • RQ3시각적 모달과 속성 모달 간의 의미 일관성이 영상 번역에서 영역 간 일반화 능력을 얼마나 향상시키는가?
  • RQ4알려진 도메인의 수가 알려지지 않은 도메인에서의 영역 간 번역 성능에 어떤 영향을 미치는가?
  • RQ5특징 보간을 통해 알려지지 않은 도메인의 연속적인 변화에 일반화할 수 있는가?

주요 결과

  • ZstGAN은 FLO 데이터셋에서 알려지지 않은 도메인에서 정확도(top-1 accuracy)가 34.06%에 이르며, 최신 기술보다 뛰어난 성능을 보였다.
  • 제거 실험 결과, 분류 손실, 적대적 손실, 복원 손실, 상호정보 최대화 손실 중 어느 하나라도 제거할 경우 성능이 크게 떨어지며, 전체 훈련 체계의 필요성을 확인한다.
  • 알려진 도메인의 수가 증가할수록 알려지지 않은 도메인에서의 성능이 향상되며, FLO 데이터셋에서 도메인 수 M=20일 경우 정확도가 17.13%에서 M=82일 경우 34.06%로 상승한다.
  • 이미지 또는 텍스트에서 도메인별 특징을 보간하면 부드럽고 연속적인 번역 결과를 생성하며, 이는 모델이 연속적인 의미 공간에서 알려지지 않은 도메인으로 일반화할 수 있음을 보여준다.
  • 모델은 배경 요소와 같은 도메인에 영향을 받지 않는 콘텐츠를 효과적으로 유지하면서도 새로운 도메인별 스타일에 적응함으로써, 특징의 효과적인 분리가 이루어졌음을 시사한다.
  • ZstGAN은 이산적인 도메인 레이블을 초월하여 훈련 세트에 포함되지 않은 도메인에 대해서도 타당한 번역 결과를 생성할 수 있으며, 이는 모델의 비지도 능력을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.