Skip to main content
QUICK REVIEW

[논문 리뷰] Emerging Disentanglement in Auto-Encoder Based Unsupervised Image Content Transfer

Ori Press, Tomer Galanti|arXiv (Cornell University)|2020. 01. 14.
Generative Adversarial Networks and Image Synthesis인용 수 20
한 줄 요약

이 논문은 단일 인코더와 단일 디코더를 갖춘 간단한 오토인코더 아키텍처를 제안하며, 공유된 콘텐츠와 도메인별 콘텐츠를 분리함으로써 분리된 표현을 달성하는 비지도 이미지 콘텐츠 전이를 수행한다. 소스 도메인 이미지의 도메인별 성분을 0으로 설정하고 타겟 도메인의 참조 이미지를 사용함으로써, 안경이나 얼굴 털과 같은 구조적 속성을 높은 정확도로 성공적으로 전이한다. 이는 복잡한 손실 설계 없이도 이전 방법들보다 분리도와 재구성 품질에서 뛰어난 성능을 보인다.

ABSTRACT

We study the problem of learning to map, in an unsupervised way, between domains A and B, such that the samples b in B contain all the information that exists in samples a in A and some additional information. For example, ignoring occlusions, B can be people with glasses, A people without, and the glasses, would be the added information. When mapping a sample a from the first domain to the other domain, the missing information is replicated from an independent reference sample b in B. Thus, in the above example, we can create, for every person without glasses a version with the glasses observed in any face image. Our solution employs a single two-pathway encoder and a single decoder for both domains. The common part of the two domains and the separate part are encoded as two vectors, and the separate part is fixed at zero for domain A. The loss terms are minimal and involve reconstruction losses for the two domains and a domain confusion term. Our analysis shows that under mild assumptions, this architecture, which is much simpler than the literature guided-translation methods, is enough to ensure disentanglement between the two domains. We present convincing results in a few visual domains, such as no-glasses to glasses, adding facial hair based on a reference image, etc.

연구 동기 및 목표

  • 소스 도메인에 존재하지 않는 타겟 도메인에 추가로 존재하는 구조적 콘텐츠를 갖는 비지도 이미지 번역 문제를 해결하기 위해.
  • 도메인 B의 단일 참조 이미지를 사용하여 도메인 A에서 도메인 B로 콘텐츠 전이를 수행함으로써, 추가된 모든 콘텐츠가 충실하게 복제됨을 보장하기 위해.
  • 공유된 콘텐츠와 도메인별 속성 간의 분리된 표현을 달성하기 위해 최소한의 아키텍처와 손실 함수를 사용하기 위해.
  • 분리도가 미약한 가정 하에 자연스럽게 유도되며, 복잡한 사이클 일致성 또는 적대적 제약 조건이 필요로 하지 않는다는 것을 보여주기 위해.
  • 기존의 다수의 네트워크나 복잡한 손실 항목에 의존하는 지도 기반 번역 방법에 대한 더 단순한 대안을 제공하기 위해.

제안 방법

  • 공유된 이중 경로 인코더가 양 도메인을 모두 처리하여 공유 콘텐츠 표현과 도메인별 표현을 생성한다.
  • 모든 소스 도메인 샘플(도메인 A)에 대해 도메인별 성분을 0으로 설정함으로써, 공유 콘텐츠와 고유 콘텐츠 간의 분리가 강제된다.
  • 공유된 단일 디코더가 병합된 표현에서 이미지를 재구성함으로써, 양 도메인 모두에서 재구성 기능을 수행한다.
  • 학습 목표는 양 도메인 모두의 재구성 손실과 공유 표현 학습을 장려하기 위한 도메인 혼동 손실 외에는 추가 손실이 없으며.
  • 모델은 A에서 B로의 단방향 매핑을 수행하며, B 도메인의 참조 이미지를 사용해 도메인별 콘텐츠를 주입한다.
  • 이 방법은 이중 작동이 가능하다: 도메인별 콘텐츠를 제거하기 위해 (e₁(b), 0)를 디코딩함으로써 B에서 A로의 매핑이 가능하다.

실험 결과

연구 질문

  • RQ1공유 인코더와 디코더를 갖춘 최소한의 오토인코더 아키텍처가 비지도 이미지 번역에서 분리된 표현을 달성할 수 있는가?
  • RQ2소스 도메인 이미지의 도메인별 성분을 0으로 설정함으로써, 명시적 정규화 없이도 분리도가 자연스럽게 유도되는가?
  • RQ3단순한 손실 함수(재구성 손실과 도메인 혼동 항목만 포함)로도 고품질의 지도 기반 콘텐츠 전이를 달성할 수 있는가?
  • RQ4안경이나 얼굴 털과 같은 구조적 속성 전이에서 최신 기술 대비 모델의 성능은 어떠한가?
  • RQ5모델은 콘텐츠 전이(A→B)와 특징 제거(B→A) 모두에 사용될 수 있으며, 기존의 분리도 모델과 비교해 어떤가?

주요 결과

  • 모델은 지도 기반 이미지 번역에서 최고 수준의 성능을 달성하였으며, 정성적 결과에서 안경이나 얼굴 털과 같은 구조적 속성의 정확한 전이가 이루어짐을 보여준다.
  • 사용자 연구 결과, 안경 제거 시 제안된 방법에 대한 선호도가 92%, 얼굴 털 제거 시 89%, 미소 제거 시 91%로, Fader 네트워크보다 유의미하게 높았다.
  • 분류기 결과, 제안된 방법을 사용해 도메인 A로 변환된 이미지에서 도메인 B일 확률의 평균은 0.011로, Fader 네트워크의 0.066보다 유의미하게 낮아, 타겟 도메인 특징의 보다 우수한 제거를 나타낸다.
  • 최소한의 손실 항목으로도 고품질의 분리도를 달성하였으며, 이는 아키텍처 설계와 가중치 공유에 의해 분리도가 자연스럽게 유도됨을 보여준다.
  • 인터폴레이션 실험 결과, 공유 콘텐츠 표현이 선형적으로 인터폴레이션 가능함을 확인하였으며, 이는 분리된 표현의 타당성을 뒷받침한다.
  • 실패 사례는 주로 소스 이미지 또는 가이드 이미지의 정렬 불량에서 기인하며, 이는 모델의 강건성에 이미지 정렬의 중요성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.