Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Pose Flow Learning for Pose Guided Synthesis

Haitian Zheng, Lele Chen|arXiv (Cornell University)|2019. 09. 30.
Generative Adversarial Networks and Image Synthesis참고 문헌 45인용 수 11
한 줄 요약

이 논문은 3D 신체 모델이나 지식 기반 유량을 사용하지 않고도 복잡한 비정형 인간 자세 변형 동안 외관 세부 정보를 전달할 수 있는 비지도 자세 유량 학습 프레임워크를 제안한다. 질감 유지 목적함수와 증강 기반 자기지도 학습을 도입함으로써, 유량 추정기의 엔드 투 엔드 학습을 가능하게 하여 다중 척도 특징 정렬과 게이팅된 곱셈형 주의 모듈을 갖춘 GarmentNet 및 SynthesisNet을 통해 굵은 단계에서 정밀한 단계로의 합성 구현을 가능하게 하며, DeepFashion, MVC 및 실제 영상 데이터셋에서 최신 기준 성능을 달성한다. 또한 예상치 못한 자세와 의류 스타일에 대해 강력한 일반화 성능을 보인다.

ABSTRACT

Pose guided synthesis aims to generate a new image in an arbitrary target pose while preserving the appearance details from the source image. Existing approaches rely on either hard-coded spatial transformations or 3D body modeling. They often overlook complex non-rigid pose deformation or unmatched occluded regions, thus fail to effectively preserve appearance information. In this paper, we propose an unsupervised pose flow learning scheme that learns to transfer the appearance details from the source image. Based on such learned pose flow, we proposed GarmentNet and SynthesisNet, both of which use multi-scale feature-domain alignment for coarse-to-fine synthesis. Experiments on the DeepFashion, MVC dataset and additional real-world datasets demonstrate that our approach compares favorably with the state-of-the-art methods and generalizes to unseen poses and clothing styles.

연구 동기 및 목표

  • 기존 방법이 효과적으로 처리하지 못하는 자세 유도 이미지 합성에서의 복잡한 비정형 자세 변형과 가림 영역 문제를 해결하기 위해.
  • 비용이 많이 들거나 합성된 지식 기반 유량이 아닌, 자세 유량 추정을 위한 비지도 학습 기반을 제안함으로써 3D 인간 모델링에 의존하지 않도록 하기 위해.
  • 새로운 질감 유지 목적함수와 증강 기반 자기지도 학습을 도입하여 이미지 합성 중 외관 유지 성능을 향상시키기 위해.
  • 학습된 자세 유량과 새로운 주의 메커니즘을 활용하여 보다 우수한 정렬 및 비정렬에 대한 강건성을 갖춘 굵은 단계에서 정밀한 단계로의 합성 구현을 위해.
  • 마스킹 레이어를 통한 배경 및 정체성 유지와 DensePose 분할을 키포인트 기반 자세 표현 대신 사용함으로써 현실감 있는 결과 향상

제안 방법

  • 두 단계 프레임워크: 제1단계는 질감 세부 정보를 유지하는 비지도 목적함수를 사용하고 데이터 증강을 통한 자기지도 학습을 활용해 유량 추정기를 학습한다.
  • 학습된 자세 유량의 품질 향상을 위해 새로운 질감 유지 목적함수를 도입하여 외관 전달에 핵심적인 영향을 미친다.
  • 제2단계는 GarmentNet 및 SynthesisNet을 활용하며, 학습된 유량 기반의 다중 척도 특징 도메인 와핑을 통해 굵은 단계에서 정밀한 단계로의 이미지 합성을 수행한다.
  • 비정렬 문제를 명시적으로 처리하기 위해 소스 및 타겟 특징에서 학습된 주의를 기반으로 특징을 필터링하는 게이팅된 곱셈형 주의 모듈을 제안한다.
  • 모든 네트워크에 마스킹 레이어를 통합하여 타겟 이미지의 배경과 정체성을 유지함으로써 합성의 현실감을 향상시킨다.
  • 자세 입력으로 DensePose 분할을 사용하여 키포인트 기반 표현보다 더 풍부한 기하학적 및 의미적 정보를 제공한다.

실험 결과

연구 질문

  • RQ13D 모델링이나 지식 기반 유량 없이도 비지도 자세 유량 학습 기반으로 복잡한 비정형 인간 자세 변형 동안 외관 세부 정보를 효과적으로 전달할 수 있는가?
  • RQ2질감 유지 목적함수는 이미지 합성에서 외관 전달을 위한 학습된 자세 유량의 품질을 향상시키는가?
  • RQ3다중 척도 특징 정렬과 주의 기반 비정렬 보정을 갖춘 굵은 단계에서 정밀한 단계로의 합성 파이프라인은 예상치 못한 자세와 의류 스타일에 대해 기존 방법을 초월할 수 있는가?
  • RQ4어려운 자세 변화와 가림 현상이 있는 실제 영상 및 제약 없는 환경에 대해 제안된 방법의 일반화 능력은 어느 정도인가?
  • RQ5키포인트 기반 자세 표현 대신 DensePose 분할을 사용할 경우 더 정확하고 세밀한 합성 결과를 얻을 수 있는가?

주요 결과

  • 제안된 방법은 DeepFashion 데이터셋에서 최신 기준 성능을 달성하였으며, Fréchet Inception Distance (FID)는 3.603 ± 0.300, 인지적 유사도 점수는 0.853을 기록하였다.
  • MVC 데이터셋에서 FID는 3.451 ± 0.426, 인지적 유사도는 0.857을 기록하여 DSCF 및 Vunet과 같은 기존 방법을 모두 능가하였다.
  • MVC 데이터셋에서의 미세조정을 통해 성능이 향상되었으며, FID는 3.365 ± 0.273, 인지적 유사도는 0.859를 기록하였다.
  • 실제 영상 데이터에 대해 잘 일반화되어 있으며, 고해상도 질감 세부 정보를 갖춘 시간적으로 일관된 프레임을 생성함을 Amazon Fashion 영상 데이터를 통해 입증하였다.
  • 실제 영상 테스트에서 다양한 자세와 의류 스타일 간 의류 전이가 성공적으로 이루어졌으며, 시각적 타당성과 정체성 일관성이 유지되었다.
  • 제거 실험 결과, 질감 유지 목적함수와 증강 기반 자기지도 학습이 유량 품질 향상과 합성 정밀도 향상에 효과적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.