Skip to main content
QUICK REVIEW

[논문 리뷰] Image-to-image Translation via Hierarchical Style Disentanglement

Xinyang Li, Shengchuan Zhang|arXiv (Cornell University)|2021. 03. 02.
Generative Adversarial Networks and Image Synthesis참고 문헌 51인용 수 9
한 줄 요약

이 논문은 이미지 간 번역을 위한 새로운 프레임워크인 계층적 스타일 분리(HiSD)를 제안한다. 이 프레임워크는 레이블을 상호 독립적인 태그와 상호 배타적인 속성으로 구성된 계층적 트리로 정렬하여, 분리된, 제어 가능한 스타일 조작을 가능하게 한다. 주어진 태그에 관련된 스타일을 주어진 주의 맵과 조건부 판별기를 사용한 비지도 분리 기반으로 학습함으로써, HiSD는 전역적 또는 정체성 유지를 위한 잡음 없이도 현실적이고 다양한, 정밀한 번역을 달성한다. 이는 CelebA-HQ에서 최신 기준의 정성적 및 정량적 결과로 검증되었다.

ABSTRACT

Recently, image-to-image translation has made significant progress in achieving both multi-label (\ie, translation conditioned on different labels) and multi-style (\ie, generation with diverse styles) tasks. However, due to the unexplored independence and exclusiveness in the labels, existing endeavors are defeated by involving uncontrolled manipulations to the translation results. In this paper, we propose Hierarchical Style Disentanglement (HiSD) to address this issue. Specifically, we organize the labels into a hierarchical tree structure, in which independent tags, exclusive attributes, and disentangled styles are allocated from top to bottom. Correspondingly, a new translation process is designed to adapt the above structure, in which the styles are identified for controllable translations. Both qualitative and quantitative results on the CelebA-HQ dataset verify the ability of the proposed HiSD. We hope our method will serve as a solid baseline and provide fresh insights with the hierarchically organized annotations for future research in image-to-image translation. The code has been released at https://github.com/imlixinyang/HiSD.

연구 동기 및 목표

  • 기존의 다중 레이블 및 다중 스타일 이미지 간 번역 방법에서 관찰되는 독립성과 배타성의 부족을 해결함으로써, 정체성 또는 배경 변경과 같은 제어되지 않은 조작을 방지한다.
  • 각 태그(예: 안경, 헤어 컬러)가 고유하고 해석 가능하며 분리된 시각적 스타일과 관련되도록 스타일 표현을 분리한다.
  • 스타일 분리에 대한 감독 주석이 필요 없이도 잠재 변수 유도 및 참조 기반 스타일 전이를 모두 가능하게 하며, 개별 속성에 대해 정밀한 제어를 가능하게 한다.
  • 전역 조작과 암묵적 속성 유출을 방지하기 위해 주의 맵과 태그 무관 판별기를 활용한 학습 프레임워크를 설계한다.

제안 방법

  • 메서드는 레이블을 계층적 구조로 정렬한다: 독립 태그(예: 'With_Bangs')와 상호 배타적 속성(예: 'Blond_Hair' 대비 'Black_Hair')로 나누어 속성과 스타일을 별도로 모델링한다.
  • 지역 번역기는 주의 맵을 사용하여 스타일 조작을 국소화된 영역에 국한시켜 전역적 또는 정체성 유지 잡음의 발생을 줄인다.
  • 목표 속성과 관련이 없는 레이블을 조작하지 않도록 방지하기 위해 태그 무관 조건부 판별기를 도입한다.
  • 프레임워크는 두 가지 스타일 생성 모드를 지원한다: 맵퍼 네트워크를 통한 잠재 코드 생성과 스타일 인코더를 활용한 참조 이미지 기반 스타일 추출.
  • 생성된 스타일과 추출된 스타일이 모두 정체성과 콘텐츠 무결성을 유지하도록 사이클 일致성 및 스타일 일치 손실을 적용한다.
  • 학습 안정성을 확보하기 위해 ResBlocks, AdaIN 레이어, 힌지 손실 및 R1 정규화를 적용한 수정된 GAN 아키텍처를 사용한다.

실험 결과

연구 질문

  • RQ1계층적 레이블 구조가 이미지 간 번역에서 독립적이고 배타적인 속성에 대해 스타일을 효과적으로 분리할 수 있는가?
  • RQ2태그 관련 스타일의 비지도 분리가 정체성 또는 배경 잡음 없이 제어 가능하고 다양하며 현실적인 이미지 번역을 가능하게 하는가?
  • RQ3학습된 스타일 공간 내에서 연속적인 보간을 통해 미리 보지 못한 스타일 조합으로 일반화가 가능한가?
  • RQ4주의 맵과 태그 무관 판별기의 사용이 분리도 향상과 제어되지 않은 전역 조작 감소에 기여하는가?
  • RQ5참조 이미지에서 추출된 스타일 코드가 감독 없이도 정확하고 다양한 스타일 전이를 가능하게 하는가?

주요 결과

  • 제안된 HiSD 프레임워크는 CelebA-HQ에서 최신 기준의 성능을 달성하여 다수의 속성과 스타일에 걸쳐 다양한, 현실적인 번역 결과를 생성한다.
  • 추출된 태그 관련 스타일 코드 간 보간은 부드러운 전이를 보여주며, 학습된 스타일 공간의 연속성과 분리도를 확인한다.
  • t-SNE 시각화 결과, 동일한 속성에 대한 스타일 코드가 속성 감독 없이도 임bedding 공간 내에서 군집을 이룬다.
  • qualitative 비교를 통해 StarGANv2 및 SDIT와의 비교에서 번역 과정에서 정체성 및 배경 변경을 성공적으로 방지함을 확인하였다.
  • 프레임워크는 잠재 변수 유도 및 참조 기반 스타일 전이 모두를 지원하며, 다양한 유형의 속성 조작에 걸쳐 일관된 성능을 보였다.
  • 제거 실험 결과, 지역 번역기와 태그 무관 판별기가 제어되지 않은 전역 조작 감소와 분리도 향상에 필수적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.