Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Explicit Domain Supervision for Latent Space Disentanglement in Unpaired Image-to-Image Translation

Jianxin Lin, Zhibo Chen|arXiv (Cornell University)|2019. 02. 11.
Generative Adversarial Networks and Image Synthesis참고 문헌 42인용 수 6
한 줄 요약

이 논문은 사전에 학습된 도메인 분류기와 함께 명시적인 도메인 감독을 통해 도메인별 특징과 도메인에 독립적인 특징을 분리하는, 새로운 비쌍체 이미지 간 번역 프레임워크인 DosGAN을 제안한다. 분류기의 특징을 명시적인 도메인 신호로 활용함으로써 DosGAN은 조건부 및 무조건적 번역 작업에서 최신 기술 수준의 성능을 달성하며, 미사용 도메인으로의 제로샷 전이 및 임의의 이미지 쌍을 사용한 조건부 번역을 가능하게 한다.

ABSTRACT

Image-to-image translation tasks have been widely investigated with Generative Adversarial Networks (GANs). However, existing approaches are mostly designed in an unsupervised manner while little attention has been paid to domain information within unpaired data. In this paper, we treat domain information as explicit supervision and design an unpaired image-to-image translation framework, Domain-supervised GAN (DosGAN), which takes the first step towards the exploration of explicit domain supervision. In contrast to representing domain characteristics using different generators or domain codes, we pre-train a classification network to explicitly classify the domain of an image. After pre-training, this network is used to extract the domain-specific features of each image. Such features, together with the domain-independent features extracted by another encoder (shared across different domains), are used to generate image in target domain. Extensive experiments on multiple facial attribute translation, multiple identity translation, multiple season translation and conditional edges-to-shoes/handbags demonstrate the effectiveness of our method. In addition, we can transfer the domain-specific feature extractor obtained on the Facescrub dataset with domain supervision information to unseen domains, such as faces in the CelebA dataset. We also succeed in achieving conditional translation with any two images in CelebA, while previous models like StarGAN cannot handle this task.

연구 동기 및 목표

  • 비쌍체 이미지 간 번역에서 도메인 레이블이 자주 존재하지만 활용되지 않는 문제를 해결하기 위해, 도메인 정보의 명시적 활용 부족을 해결한다.
  • 도메인 정체성을 명시적 감독으로 간주하여 도메인별 특징과 도메인에 독립적인 특징의 분리 성능을 향상시킨다.
  • 재학습 없이도 새로운 데이터셋에 대해 도메인 특화 특징 추출기를 제로샷 전이할 수 있도록 한다.
  • 스타일 기반 모델인 StarGAN이 지원하지 않는 바, 임의의 소스 및 기준 이미지를 사용한 조건부 이미지 번역을 지원한다.

제안 방법

  • 비쌍체 데이터에서 도메인 레이블을 사용하여 깊은 CNN 분류기를 사전 학습하여 이미지의 도메인을 예측한다.
  • 사전 학습된 분류기의 두 번째 마지막 레이어를 각 이미지의 도메인 특화 특징 추출기로 사용한다.
  • 공유 인코더로부터 추출한 도메인에 독립적인 특징과 도메인 특화 특징을 결합하여 목표 도메인 이미지를 생성한다.
  • 재구성 오차(자기 및 상호 도메인)를 최소화하기 위해 GAN 손실과 이중 학습을 사용하여 생성기와 인코더를 동시에 학습한다.
  • 학습 안정화를 위해 두 가지 핵심 손실을 도입한다: 이미지 재구성 손실(ℓ_im)과 도메인 특화 특징 재구성 손실(ℓ_α,f).
  • 생성기 및 인코더와의 공동 학습 이전에 도메인 분류기(α(·))를 별도로 사전 학습하여 최적화한다.

실험 결과

연구 질문

  • RQ1비쌍체 이미지 간 번역에서 명시적인 도메인 감독이 도메인별 특징과 도메인에 독립적인 특징의 분리 성능을 향상시킬 수 있는가?
  • RQ2엔드 투 엔드 학습과 비교해 사전 학습된 도메인 분류기가 특징 분리 성능을 어떻게 향상시키는가?
  • RQ3사전 학습된 도메인 특화 특징 추출기는 추가 튜닝 없이도 새로운 도메인으로 전이될 수 있는가?
  • RQ4모델은 서로 다른 도메인에 속한 두 이미지를 입력으로 사용해도 조건부 번역을 수행할 수 있는가?
  • RQ5명시적 도메인 모델링과 암묵적 도메인 모델링 간 번역 품질 및 특징 분리 성능를 비교했을 때 어떤 것이 더 우수한가?

주요 결과

  • DosGAN은 여러 정체성 번역에서 94.01%의 상위-1 정확도를 기록하며, 사전 학습 또는 핵심 손실이 없는 변종보다 뚜렷이 뛰어나다.
  • Edge-to-Shoes 번역에서 FID 점수 50.0점, Edge-to-Handbags 번역에서도 FID 점수 50.0점으로, CycleGAN 및 DRIT과 같은 비지도 모델을 능가한다.
  • 사람의 시각적 평가 연구 결과, DosGAN은 모든 비지도 기반 베이스라인을 능가하며, 사용자 78.5%가 DosGAN 결과를 더 선호함을 확인했다.
  • 절단 실험 결과, ℓ_im 또는 ℓ_α,f를 제거할 경우 정확도가 15% 이하로 떨어지며, 이는 안정적인 분리에 이 둘의 필수성을 입증한다.
  • 사전 학습된 도메인 분류기는 제로샷 전이를 가능하게 하며, Facescrub에서 학습한 특징 추출기는 추가 도메인 레이블 없이도 CelebA에 잘 일반화된다.
  • DosGAN-c는 임의의 두 이미지(예: 윤곽선 맵과 기준 이미지)를 입력으로 사용해 조건부 번역을 수행할 수 있으며, 이는 StarGAN이 지원하지 않는 능력이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.