Skip to main content
QUICK REVIEW

[논문 리뷰] MUST-GAN: Multi-level Statistics Transfer for Self-driven Person Image Generation

Tianxiang Ma, Bo Peng|arXiv (Cornell University)|2020. 11. 18.
Generative Adversarial Networks and Image Synthesis참고 문헌 43인용 수 4
한 줄 요약

이 논문은 쌍체 데이터가 없는 상태에서 원본 이미지의 다중 수준 외관 통계를 분리하고 전이할 수 있는 자기 주도적(person image generation) 모델인 MUST-GAN을 제안한다. 주의 메커니즘과 자세 유도 생성을 활용하여 자세 및 옷 스타일 전이가 가능한 영역에서의 탄력적인 조정이 가능하며, DeepFashion에서 최신 기술 수준(SOTA)의 성능을 달성하고 실제 환경에서도 강건한 결과를 보였다.

ABSTRACT

Pose-guided person image generation usually involves using paired source-target images to supervise the training, which significantly increases the data preparation effort and limits the application of the models. To deal with this problem, we propose a novel multi-level statistics transfer model, which disentangles and transfers multi-level appearance features from person images and merges them with pose features to reconstruct the source person images themselves. So that the source images can be used as supervision for self-driven person image generation. Specifically, our model extracts multi-level features from the appearance encoder and learns the optimal appearance representation through attention mechanism and attributes statistics. Then we transfer them to a pose-guided generator for re-fusion of appearance and pose. Our approach allows for flexible manipulation of person appearance and pose properties to perform pose transfer and clothes style transfer tasks. Experimental results on the DeepFashion dataset demonstrate our method's superiority compared with state-of-the-art supervised and unsupervised methods. In addition, our approach also performs well in the wild.

연구 동기 및 목표

  • 쌍체의 원본-대상 이미지가 필요한 감독 학습 기반의 사람 이미지 생성에서 발생하는 높은 데이터 주석 비용 문제를 해결하기 위해.
  • 원본 이미지를 재구성에 대한 감독으로 사용하여 쌍체 데이터 없이 자기 주도적 훈련을 가능하게 하기 위해.
  • 정체성과 자세를 유지하면서 다중 수준 외관 특징(색상, 질감, 스타일)을 분리하고 전이하기 위해.
  • 자세 및 외관 속성의 독립적 조작이 가능한 탄력적이고 제어 가능한 이미지 조작을 지원하기 위해.
  • 정제된 데이터셋을 넘어서 실제 환경(와일드) 설정에서의 일반화 능력을 평가하기 위해.

제안 방법

  • 사람 이미지에서 다중 수준 특징을 추출하기 위해 의미 세그멘테이션을 활용한 외관 인코더를 사용한다.
  • 다중 수준 특징 맵에서 중요한 채널을 가중치 부여하기 위해 채널 주의 메커니즘을 적용한다.
  • 완전 연결 네트워크를 통한 통계 매칭을 통해 생성기로 외관 통계를 전이한다.
  • 자세 유도 이미지 합성에 적합한 AdaIN과 학습 가능한 스킵 연결을 갖춘 다중 수준 통계 매칭 네트워크를 도입한다.
  • 자세 이미지와 자세 연결 맵을 처리하기 위해 자세 인코더를 사용하여 공간적 가이던스를 제공한다.
  • 쌍체 데이터가 필요 없이 원본 이미지만으로 끝에서 끝까지 훈련하여, 쌍체 데이터의 필요성을 제거한다.

실험 결과

연구 질문

  • RQ1높은 이미지 품질을 유지하면서도 쌍체의 원본-대상 이미지가 없는 상태에서 사람 이미지 생성 모델을 훈련시킬 수 있는가?
  • RQ2다중 수준 외관 통계는 얼마나 효과적으로 분리되고 전이되어 현실적인 이미지 합성을 가능하게 하는가?
  • RQ3이 모델은 자세와 외관 속성의 독립적 조작을 어느 정도로 가능하게 하는가?
  • RQ4이 모델은 정제된 데이터셋을 넘어서 실제 환경에서의 제약 없는 이미지에 얼마나 잘 일반화되는가?
  • RQ5이 모델은 자세 전이 및 옷 스타일 전이 작업에서 최신 기술 수준(SOTA)의 성능을 달성할 수 있는가?

주요 결과

  • DeepFashion 데이터셋에서 제안된 방법은 인ception 스코어 3.692, SSIM 0.742, FID 15.902, LPIPS 0.2412를 기록하며 기존의 감독 학습 방법을 초월한다.
  • 제거 실험 결과, MUST 모듈을 제거하면 FID는 21.928로 증가하고 LPIPS는 0.2840으로 상승하여 그 핵심적인 역할을 확인한다.
  • 채널 주의 메커니즘이 SSIM을 0.011 향상시키고 FID를 1.621 감소시켜 특징 가중치 부여의 효과를 입증한다.
  • 자세 연결 맵(PCM)을 사용할 경우 전체 모델에서 PCM 없이 사용한 것보다 FID는 0.965 향상되고 LPIPS는 0.0102 향상된다.
  • 모델은 정체성을 유지하면서 동시에 자세와 옷 스타일 전이를 성공적으로 수행한다.
  • 와일드 환경 평가에서 복잡한 배경을 가진 웹 기반 이미지에서도 실존적인 색상과 질감의 정확성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.