Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Multi-Domain Image Translation with Domain-Specific Encoders/Decoders

Le Hui, Xiang Li|arXiv (Cornell University)|2017. 12. 06.
Generative Adversarial Networks and Image Synthesis참고 문헌 29인용 수 7
한 줄 요약

이 논문은 도메인 간 전환 비용을 $O(n^2)$에서 $O(n)$으로 줄여 다중 도메인 이미지 번역의 효율성과 확장성을 향상시키는 새로운 비지도 다중 도메인 이미지 번역 프레임워크인 Domain-Bank을 제안한다. 이는 $n$개의 도메인 전용 인코더/디코더와 함께 전역 공유 오토인코더를 사용하여 모델 파라미터와 학습 시간의 복잡도를 $O(n)$으로 유지한다. 이는 기존 방법의 $O(n^2)$ 부담을 줄이는 데 기여한다. 이 프레임워크는 다수의 도메인 간 효율적이고 확장 가능한 번역을 가능하게 하며, 새로운 도메인을 추가하는 데 있어 점진적 학습을 지원하고 선형 스타일 융합을 허용하여 얼굴, 패션, 스타일 전이 벤치마크 및 도메인 적응 작업에서 최고 성능을 달성한다.

ABSTRACT

Unsupervised Image-to-Image Translation achieves spectacularly advanced developments nowadays. However, recent approaches mainly focus on one model with two domains, which may face heavy burdens with large cost of $O(n^2)$ training time and model parameters, under such a requirement that $n$ domains are freely transferred to each other in a general setting. To address this problem, we propose a novel and unified framework named Domain-Bank, which consists of a global shared auto-encoder and $n$ domain-specific encoders/decoders, assuming that a universal shared-latent sapce can be projected. Thus, we yield $O(n)$ complexity in model parameters along with a huge reduction of the time budgets. Besides the high efficiency, we show the comparable (or even better) image translation results over state-of-the-arts on various challenging unsupervised image translation tasks, including face image translation, fashion-clothes translation and painting style translation. We also apply the proposed framework to domain adaptation and achieve state-of-the-art performance on digit benchmark datasets. Further, thanks to the explicit representation of the domain-specific decoders as well as the universal shared-latent space, it also enables us to conduct incremental learning to add a new domain encoder/decoder. Linear combination of different domains' representations is also obtained by fusing the corresponding decoders.

연구 동기 및 목표

  • 다중 도메인 수치가 증가함에 따라 제곱적으로 증가하는 계산 비용과 파라미터 비용을 유발하는 기존 비지도 이미지 간 번역 모델의 문제를 해결하기 위해.
  • 전역 공유 잠재 공간을 도입하여 $n$개 도메인 간에 효율적이고 확장 가능한 다중 도메인 번역을 가능하게 하기 위해.
  • 전체 모델을 다시 학습하지 않고도 새로운 도메인을 추가할 수 있도록 점진적 학습을 지원하기 위해.
  • 도메인 전용 디코더의 선형 조합을 통해 영향력 있는 스타일 융합을 가능하게 하기 위해.
  • 다중 도메인 이미지 번역 및 도메인 적응 작업에서 최고 성능을 달성하기 위해.

제안 방법

  • 모델은 모든 도메인 전용 인코더가 이미지를 유일한 공유 잠재 공간으로 매핑하는 공유 잠재 공간 가정을 사용한다.
  • 공유 잠재 공간을 강제로 구현하기 위해 도메인 전용 인코더의 마지막 레이어와 도메인 전용 디코더의 첫 번째 레이어에 가중치 공유 제약 조건을 적용한다.
  • 모델은 $n$개의 구성 뱅크로 구성되며, 각각 도메인 전용 인코더 $E_i$, 디코더 $G_i$, 그리고 적대적 학습을 위한 판별기 $D_i$를 포함한다.
  • 학습 손실은 VAE 재구성 손실, GAN 손실, 사이클 일致성 손실을 조합하며, 도메인 적응 실험에서는 사이클 일치성 스트림을 제거한다.
  • 점진적 학습을 위해 기존 모델의 가중치는 고정하고, 뉴턴 도메인의 인코더/디코더 및 판별기만 업데이트한다.
  • 스타일 융합을 위해 목표 디코더는 $G^* = \lambda G_1 + (1-\lambda)G_2$와 같이 선형 조합하여 하이브리드 스타일 출력을 생성한다.

실험 결과

연구 질문

  • RQ1통합 프레임워크가 $O(n^2)$가 아닌 $O(n)$ 복잡도로 다중 도메인 이미지 번역을 달성할 수 있는가?
  • RQ2공유 잠재 공간이 다양한 도메인 분포를 효과적으로 표현하면서도 고품질의 이미지 번역을 가능하게 할 수 있는가?
  • RQ3기존 모델을 다시 학습하지 않고도 새로운 도메인의 점진적 학습을 지원할 수 있는가?
  • RQ4도메인 전용 디코더의 선형 조합이 제어 가능한 스타일 융합을 가능하게 할 수 있는가?
  • RQ5이 프레임워크는 다중 도메인 번역 및 도메인 적응 작업에서 최고 성능을 달성할 수 있는가?

주요 결과

  • 제안된 Domain-Bank 프레임워크는 모델 파라미터와 학습 시간을 $O(n^2)$에서 $O(n)$으로 줄여 다중 도메인 번역의 확장성을 가능하게 한다.
  • SVHN→MNIST 도메인 적응 작업에서 0.9146%의 분류 정확도를 기록하여 UNIT(0.9053%)를 능가한다.
  • MNIST→USPS에서 0.9645%의 정확도를 기록하여 UNIT의 0.9597%를 초월한다.
  • USPS→MNIST에서 0.9412%의 정확도를 기록하여 UNIT의 0.9358%를 뛰어넘는다.
  • 점진적 학습은 뉴턴 도메인의 구성 요소만 업데이트하면서도 기존 도메인의 성능을 유지하는 데 성공한다.
  • 디코더의 선형 조합은 다양한 $\lambda$ 값에 따라 점진적인 스타일 융합을 가능하게 하며, 그 결과는 그림 8에 시각화되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.