Skip to main content
QUICK REVIEW

[논문 리뷰] PT-VTON: an Image-Based Virtual Try-On Network with Progressive Pose Attention Transfer

Hanhan Zhou, Tian Lan|arXiv (Cornell University)|2021. 11. 23.
Image Enhancement Techniques참고 문헌 26인용 수 5
한 줄 요약

PT-VTON은 프로그레시브 포즈 어텐션 전달 네트워크와 이중 텍스처 전달 방법을 사용하여 사용자가 새로운 옷을 다양한 자세로 입는 고해상도 이미지 합성을 가능하게 하는 포즈 전달 기반의 가상 시도 프레임워크를 제안한다. 이는 최소한의 시스템 수정으로도 사용자 신원, 체형, 옷 소재 세부 정보를 유지하면서 다중 시점(측면 및 뒷면) 출력을 지원하여 정량적 지표와 정성적 현실감에서 이전 방법들을 능가하는 최신 기술 수준의 성능을 달성한다.

ABSTRACT

The virtual try-on system has gained great attention due to its potential to give customers a realistic, personalized product presentation in virtualized settings. In this paper, we present PT-VTON, a novel pose-transfer-based framework for cloth transfer that enables virtual try-on with arbitrary poses. PT-VTON can be applied to the fashion industry within minimal modification of existing systems while satisfying the overall visual fashionability and detailed fabric appearance requirements. It enables efficient clothes transferring between model and user images with arbitrary pose and body shape. We implement a prototype of PT-VTON and demonstrate that our system can match or surpass many other approaches when facing a drastic variation of poses by preserving detailed human and fabric characteristic appearances. PT-VTON is shown to outperform alternative approaches both on machine-based quantitative metrics and qualitative results.

연구 동기 및 목표

  • 임의의 사용자 자세에서 현실적인 가상 시도를 구현하는 데 도전하는 것, 특히 훈련 데이터와 상당히 다를 수 있는 자세와 체형을 가진 경우에 초점한다.
  • 옷 전달 과정에서 얼굴 특징, 피부 톤, 체형과 같은 세밀한 사용자 특징을 유지하는 것.
  • 3D 복원이나 물리적 측정치 없이도 2D 이미지만으로도 360도 가상 시도 기능을 제공하는 것.
  • 기존 모델 이미지 컬렉션에 의존하면서도 통합 노력이 최소한인 패션 산업에 적용 가능한 실용적 프레임워크를 개발하는 것.
  • 다양한 복잡도를 가진 의류 유형에 대응하기 위해 포즈 인식 워핑과 두 가지 특화된 텍스처 전달 전략을 융합하여 텍스처 전달의 정확도를 향상시키는 것.

제안 방법

  • 프레임워크는 사용자 입력 이미지의 자세와 가장 유사한 모델 이미지를 선택하기 위해 자세 유사도 평가 모듈을 사용한다.
  • 진행적 포즈 어텐션 전달 네트워크(PATN)는 관건점 유도 특징 정렬과 인지 기반 기하 일치 손실을 사용하여 모델의 옷을 입은 이미지를 사용자의 자세에 맞게 왜곡한다.
  • 전이 학습을 활용한 이중 단계 훈련 전략을 통해 사전 훈련된 모델과 모델 이미지에 대한 배치 훈련을 통해 특징 보존을 향상시킨다.
  • 두 가지 텍스처 전달 방법을 사용한다: 단순한 경우는 가우시안 스무딩을 적용한 복사-붙여넣기이며, 복잡하거나 일치하지 않는 의류 유형의 경우는 텍스처 번역 네트워크를 사용한다.
  • 조건부 세그멘테이션 마스크는 소스와 타겟 신체 영역 간 정확한 정렬을 보장하는 데 사용된다.
  • 옷 유형의 변화가 큰 경우(예: 긴 소매에서 짧은 소매로 전환) 시스템은 모델에서 유도된 사지와 색상이 일치하는 피부 톤을 사용하여 누락된 신체 부위를 보완한다.

실험 결과

연구 질문

  • RQ13D 복원이나 물리적 측정치 없이 2D 가상 시도 시스템이 임의의 자세에서 세밀한 사용자 신원과 옷의 외관을 유지할 수 있는가?
  • RQ2원본과 대상 자세가 상당히 다를 경우 포즈 전달을 어떻게 최적화하여 구조적 일致성과 시각적 현실감을 유지할 수 있는가?
  • RQ3제한된 사용자 데이터와 풍부한 모델 이미지를 사용할 때 효과적인 특징 보존을 위한 훈련 전략은 무엇인가?
  • RQ4다단계 프레임워크는 신원 유지 능력을 유지하면서도 다중 시점 가상 시도(예: 측면 및 뒷면)를 지원할 수 있는가?
  • RQ5다양한 복잡도와 자세 불일치 상황에서 다양한 텍스처 전달 전략의 성능과 내성은 어떻게 비교될 수 있는가?

주요 결과

  • PT-VTON은 인ception 스코어(IS) 3.28을 기록하여 CP-VTON(2.66), SwapNet(3.04), Sievenet(2.91)을 모두 능가하며, 더 높은 이미지 품질을 나타낸다.
  • 복사-붙여넣기 텍스처 전달 방법을 사용할 경우 SSIM은 0.833, MS-SSIM는 0.839를 기록하여 다른 베이스라인 대비 구조적 유사성에서 뛰어난 성능을 보였다.
  • 시스템은 100건의 가상 시도 요청을 평균 6초 내에 처리하여 대규모 배포에 적합한 낮은 지연 시간을 확보했다.
  • 정성적 결과에서는 측면 및 뒷면 시점 포함 다양한 자세에서도 얼굴 특징, 피부 톤, 체형이 일관되게 유지되는 것으로 나타났다.
  • 절단 분석 결과 전용 훈련 전략과 PATN 아키텍처가 표준 포즈 전달 네트워크보다 성능 향상에 크게 기여하는 것으로 확인되었다.
  • 실패 사례는 주로 관건점 맵의 불일치에서 기인하며, 극단적인 자세에서 자세 추정 정확도에 민감함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.