Skip to main content
QUICK REVIEW

[논문 리뷰] Mask Based Unsupervised Content Transfer

Ron Mokady, Sagie Benaim|arXiv (Cornell University)|2019. 06. 15.
Generative Adversarial Networks and Image Synthesis참고 문헌 48인용 수 5
한 줄 요약

이 논문은 생성된 마스크에 의해 유도되는 새로운 주의 메커니즘을 사용하여 도메인 불변 및 도메인 특화 콘텐츠를 분리하는 마스크 기반 비지도 콘텐츠 전이 방법을 제안한다. 이는 전체 이미지를 재구성하지 않고도 고품질의 국소적 콘텐츠 전이를 가능하게 한다. 이 방법은 콘텐츠 전이 품질과 다양성에서 최신 기술 수준(SOTA)의 성과를 달성하며, 클래스 수준의 애너테이션만을 사용하여 전이된 콘텐츠의 약한 지도 세그멘테이션도 가능하게 한다.

ABSTRACT

We consider the problem of translating, in an unsupervised manner, between two domains where one contains some additional information compared to the other. The proposed method disentangles the common and separate parts of these domains and, through the generation of a mask, focuses the attention of the underlying network to the desired augmentation alone, without wastefully reconstructing the entire target. This enables state-of-the-art quality and variety of content translation, as demonstrated through extensive quantitative and qualitative evaluation. Our method is also capable of adding the separate content of different guide images and domains as well as remove existing separate content. Furthermore, our method enables weakly-supervised semantic segmentation of the separate part of each domain, where only class labels are provided. Our code is publicly available at https://github.com/rmokady/mbu-content-tansfer.

연구 동기 및 목표

  • 쌍이 맞지 않는 도메인 간 비지도 콘텐츠 전이를 해결하며, 한 도메인에는 다른 도메인에 존재하지 않는 추가 속성(예: 안경)이 포함된 경우를 대상으로 한다.
  • 목표 이미지의 관련 영역에만 네트워크 주의를 집중시켜 불필요한 세부 사항 재구성 없이 생성 품질을 향상시킨다.
  • 이미지 간 속성의 추가, 제거 또는 교환을 포함한 영역에 유연한 콘텐츠 조작을 가능하게 한다.
  • 클래스 수준의 레이블만을 사용하여 전이된 콘텐츠의 약한 지도 세그멘테이션을 수행한다.
  • 쌍이 맞는 훈련 데이터나 명시적 세그멘테이션 애너테이션 없이도 콘텐츠와 스타일을 분리할 수 있도록 한다.

제안 방법

  • 이 방법은 도메인 간 공통으로 사용되는 도메인 불변 콘텐츠와 각 도메인 고유의 도메인 특화 콘텐츠를 분리하기 위해 분리된 오토인코더 유사 아키텍처를 사용한다.
  • 마스크 생성 네트워크는 목표 이미지에서 도메인 특화 콘텐츠를 추가할 공간적 영역을 식별하여 국소적 주의를 가능하게 하고, 재구성 부담을 줄인다.
  • 네트워크는 사이클 일致성, 양 도메인에 대한 재구성 손실, 그리고 의미적 분리를 보장하기 위한 새로운 분리 손실($\mathcal{L}_{DC}$)의 조합으로 훈련된다.
  • 목표 도메인에 대해 자기 정규화 손실($\mathcal{L}^{A}_{Recon2}$)을 적용하여 마스크가 관련 콘텐츠만 포착하도록 유도함으로써 마스크의 흐린 정도와 정확도를 향상시킨다.
  • 이 방법은 도메인 특화 콘텐츠를 의미적으로 인지하는 잠재 공간을 활용하여 정밀한 국소화와 고해상도 전이를 가능하게 한다.
  • 마스크 출력은 콘텐츠 전이와 약한 지도 세그멘테이션 양쪽 모두에 사용되며, 경계 상자나 픽셀 수준의 애너테이션 필요 없이 작동한다.

실험 결과

연구 질문

  • RQ1쌍이 맞지 않는 도메인 간에 전체 목표 이미지를 재구성하지 않고도 고품질이고 다양한 콘텐츠 전이를 달성할 수 있는가?
  • RQ2주의 마스크를 사용하여 특정 영역으로 콘텐츠 전이를 국소화할 수 있는가? 이는 생성 품질과 효율성을 향상시키는가?
  • RQ3생성된 마스크가 클래스 수준의 애너테이션만을 사용하여 약한 지도 세그멘테이션 맵으로 기능할 수 있는가?
  • RQ4이 방법은 콘텐츠 추가 및 제거를 모두 수행할 수 있으며, 이미지 간 속성 교환을 위한 영역에 민감한 유연한 조작을 가능하게 하는가?
  • RQ5다양한 손실 구성 요소가 마스크 품질, 분리 성능, 전이 성능에 미치는 영향은 어떠한가?

주요 결과

  • 이 방법은 콘텐츠 전이 품질과 다양성에서 최신 기술 수준(SOTA)의 성능을 달성하며, 정량적 지표와 정성적 평가 모두에서 이전 비지도 방법들을 능가한다.
  • 전이된 콘텐츠(예: 안경, 얼굴 털)의 세그멘테이션에 대해 교차합집합(IoU)이 이전의 약한 지도 세그멘테이션 방법을 초월하며, 안경의 경우 평균 IoU가 0.881, 얼굴 털의 경우 0.885를 기록한다.
  • 제거 실험 결과, $\mathcal{L}^{A}_{Recon2}$ 손실을 제거할 경우 분류기 정확도가 9.7% 감소함을 확인하여, 이 손실이 마스크 국소화와 분리에 핵심적인 역할을 한다는 것을 입증한다.
  • $\mathcal{L}_{Cycle}$ 손실이 없을 경우 마스크는 평균적으로 얼굴의 29%를 커버하지만, 분류기 정확도는 67.1%로 떨어지며, 사이클 일치성이 의미적 정확성을 유지하는 데 기여한다는 것을 보여준다.
  • 이 방법은 훈련 도메인 외부의 이미지도 성공적으로 전이할 수 있어 강력한 일반화 능력과 내성적 안정성을 입증한다.
  • 생성된 마스크는 지도 세그멘테이션에 대해 충분히 정확하여, 지도 세그멘테이션 지도 없이도 높은 IoU 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.