Skip to main content
QUICK REVIEW

[논문 리뷰] Controllable Person Image Synthesis with Spatially-Adaptive Warped Normalization

Jichao Zhang, Aliaksandr Siarohin|arXiv (Cornell University)|2021. 05. 31.
Generative Adversarial Networks and Image Synthesis참고 문헌 65인용 수 7
한 줄 요약

이 논문은 사람 이미지 생성에서 자세와 스타일 특징 간 정확한 공간적 정렬을 위해 학습된 플로우 필드를 사용해 스타일 조정 파라미터(스케일 및 바이어스)를 왜곡하는 새로운 정규화 모듈인 공간적 적응 왜곡 정규화(SAWN)를 제안한다. 또한 모델을 보완하기 위해 자기 훈련 기반 파트 교체(STPR) 전략을 도입하여 DeepFashion 데이터셋에서 자세 전이 및 복잡한 무늬 전이 작업 모두에서 최신 기술 수준(SOTA) 성능을 달성하였으며, 상의 영역에서는 FID 점수가 최소 10.50, 헤어 영역에서는 11.32에 이르렀다.

ABSTRACT

Controllable person image generation aims to produce realistic human images with desirable attributes such as a given pose, cloth textures, or hairstyles. However, the large spatial misalignment between source and target images makes the standard image-to-image translation architectures unsuitable for this task. Most state-of-the-art methods focus on alignment for global pose-transfer tasks. However, they fail to deal with region-specific texture-transfer tasks, especially for person images with complex textures. To solve this problem, we propose a novel Spatially-Adaptive Warped Normalization (SAWN) which integrates a learned flow-field to warp modulation parameters. It allows us to efficiently align person spatially-adaptive styles with pose features. Moreover, we propose a novel Self-Training Part Replacement (STPR) strategy to refine the model for the texture-transfer task, which improves the quality of the generated clothes and the preservation ability of non-target regions. Our experimental results on the widely used DeepFashion dataset demonstrate a significant improvement of the proposed method over the state-of-the-art methods on pose-transfer and texture-transfer tasks. The code is available at https://github.com/zhangqianhui/Sawn.

연구 동기 및 목표

  • 사람 이미지 생성에서 특히 복잡한 무늬에 대해 자세 특징과 스타일 특징 간 공간적 불일치 문제를 해결하기 위해.
  • 비타겟 영역의 정체성을 유지하면서도 사람 이미지 합성에서 무늬 전이 품질을 향상시키기 위해.
  • 자신의 훈련과 추론 간 도메인 갭을 줄이기 위해 자기지도 기반 파트 교체로 모델을 보완하기 위해.
  • 자세 유도 및 영역 특정 무늬 전이 작업 모두에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 학습된 플로우 필드를 사용해 정규화의 스케일 및 바이어스 파라미터를 왜곡함으로써 공간적 위치 간 스타일 및 자세 특징 간 정렬을 달성하는 공간적 적응 왜곡 정규화(SAWN)를 제안한다.
  • 영역별로 특화된 마스크를 사용해 무늬 전이 중 영역 특정 공간 정렬을 가능하게 하는 SAWN의 변종인 M-SAWN을 도입한다.
  • 스タイル 특징을 자세 유도 특징 맵과 정렬하기 위한 조밀한 공간 변환을 예측하는 플로우 필드 네트워크를 활용한다.
  • 다양한 수신장 영역에서 세밀한 스타일 정렬을 유지하기 위해 복수의 디코더 스케일에서 SAWN를 적용한다.
  • 동일한 사람의 다른 자세에서 파트를 교체함으로써 도메인 내 미세조정을 수행하는 자기 훈련 기반 파트 교체(STPR) 전략을 도입한다.
  • GAN 프레임워크를 활용한 적대적 훈련을 수행하며, 생성자는 SAWN와 STPR를 활용해 자세, 외형 및 영역 마스크 조건 하에 현실적인 사람 이미지를 합성한다.

실험 결과

연구 질문

  • RQ1학습된 플로우 필드가 사람 이미지 생성에서 공간적 적응 스타일 파라미터를 자세 특징과 효과적으로 정렬함으로써 무늬 전이 향상에 기여할 수 있는가?
  • RQ2정규화에서 스케일뿐만 아니라 바이어스 파라미터까지 왜곡하는 것이 스케일만 왜곡하는 것보다 성능 향상에 기여하는가?
  • RQ3자기 훈련 기반 파트 교체 전략이 훈련과 추론 간 격차를 줄여 현실성 향상과 정체성 유지에 기여하는가?
  • RQ4제안된 방법이 자세 및 무늬 전이 과정에서 복잡한 무늬를 처리하는 데 있어 최신 기술 수준(SOTA)과 비교해 어떻게 성능을 내는가?

주요 결과

  • 제안된 SAWN 방법은 DeepFashion 데이터셋에서 FID 점수 11.54를 기록하여 베이스라인 SAN(14.99)과 SAWS(12.04)를 초월한다.
  • SAWN과 STPR를 모두 적용한 최종 모델은 '상의' 영역에서 FID 10.50, '헤어' 영역에서 FID 11.32를 기록하여 현실성과 세부 무늬 전이 향상이 뚜렷하게 확인된다.
  • STPR 전략은 STPR가 없는 모델 대비 '상의' 영역에서 FID를 5.22점 감소시키고 '바지' 영역에서는 1.68점 감소시켜 품질 향상 효과를 입증한다.
  • 시각화 결과는 학습된 플로우 필드와 가림 마스크가 타겟 사람의 형태와 외형을 잘 반영하는 타당한 왜곡 결과를 생성함을 확인한다.
  • 특히 빨간색과 흰색의 체크 패tern과 같은 복잡한 패atters에서 ADGAN 및 PISE 보다 더 선명한 무늬를 생성함을 확인하였으며, 이는 기존 베이스라인에서 잘 보존되지 않는 영역임을 시사한다.
  • 제거 분석 결과 스케일과 바이어스 파라미터를 모두 왜곡하는 SAWN가 스케일만 왜곡하는 SAWS보다 우수함을 입증하여 전체 파라미터 왜곡의 필요성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.