[논문 리뷰] Towards Multi-pose Guided Virtual Try-on Network
이 논문은 다양한 자세에서 원하는 옷을 사람에게 부착하여 현실적인 인물 이미지를 합성하는 데 중점을 두고 있는 새로운 다단계 프레임워크 MG-VTON을 제안한다. 이는 자세와 옷에 기반한 인간 퍼싱, 포즈 유도 오차를 줄이기 위한 워핑 GAN, 그리고 다중 자세 조합 마스크를 활용한 정밀도 향상 네트워크를 통해 실현 가능하다. 이는 MPV 및 DeepFashion 데이터셋에서 기존 최고 성능(SOTA) 방법들을 크게 앞서며, 특히 세밀한 디테일 복구와 정확한 자세 일치를 가능하게 한다.
Virtual try-on system under arbitrary human poses has huge application potential, yet raises quite a lot of challenges, e.g. self-occlusions, heavy misalignment among diverse poses, and diverse clothes textures. Existing methods aim at fitting new clothes into a person can only transfer clothes on the fixed human pose, but still show unsatisfactory performances which often fail to preserve the identity, lose the texture details, and decrease the diversity of poses. In this paper, we make the first attempt towards multi-pose guided virtual try-on system, which enables transfer clothes on a person image under diverse poses. Given an input person image, a desired clothes image, and a desired pose, the proposed Multi-pose Guided Virtual Try-on Network (MG-VTON) can generate a new person image after fitting the desired clothes into the input image and manipulating human poses. Our MG-VTON is constructed in three stages: 1) a desired human parsing map of the target image is synthesized to match both the desired pose and the desired clothes shape; 2) a deep Warping Generative Adversarial Network (Warp-GAN) warps the desired clothes appearance into the synthesized human parsing map and alleviates the misalignment problem between the input human pose and desired human pose; 3) a refinement render utilizing multi-pose composition masks recovers the texture details of clothes and removes some artifacts. Extensive experiments on well-known datasets and our newly collected largest virtual try-on benchmark demonstrate that our MG-VTON significantly outperforms all state-of-the-art methods both qualitatively and quantitatively with promising multi-pose virtual try-on performances.
연구 동기 및 목표
- 기존 방법들이 포즈 유도 오차와 신원 및 텍스처 디테일 손실로 인해 다양한 자세에서의 현실적인 가상 피팅을 처리하지 못하는 문제를 해결하기 위함.
- 3D 모델이나 광범위한 수동 애너테이션 없이도 2D 인물 이미지에서 옷 이동과 자세 조작을 동시에 수행할 수 있는 방법을 개발하기 위함.
- 포즈, 옷, 인간 신체 구조 간의 상호작용을 체계적인 감독을 통해 모델링하여 생성된 이미지의 정밀도를 향상시키기 위함.
- 다양한 자세와 의류 변화를 포함하는 새로운 벤치마크 데이터셋 MPV를 구축하여 다자세 가상 피팅 평가를 위한 기준을 마련하기 위함.
제안 방법
- 자신의 신체 이미지, 원하는 옷, 목표 자세를 기반으로 조건부로 타겟 인간 퍼싱 맵을 생성하는 자세-의류 유도 인간 퍼싱 네트워크를 통해 정확한 신체 부위 정위치를 가능하게 한다.
- 기하학적 변환 추정을 이용해 원하는 옷 이미지를 합성된 퍼싱 맵으로 워핑하는 딥 워핑 생성적 적대적 네트워크(Warp-GAN)를 통해 원본과 대상 자세 간의 오차를 줄인다.
- 다중 자세 조합 마스크를 활용하여 워핑 및 자세 조작 과정에서 발생한 아티팩트를 억제하고 세밀한 텍스처 디테일을 복구하는 정밀도 향상 네트워크를 적용한다.
- 실제성과 구조적 일관성을 향상시키기 위해 적대적 손실, 지각적 손실, 다중 자세 조합 마스크 손실을 함께 사용한다.
- 새로가 수집한 MPV 데이터셋에서 엔드 투 엔드로 학습하고, DeepFashion에서 평가하며, 인간 평가를 위해 아마존 메카니컬 터크에서 A/B 테스트를 실시한다.
- 복잡한 가상 피팅 작업을 세 단계로 분해한다: 퍼싱 생성, 워핑을 통한 거친 이미지 합성, 고해상도 정밀도 보정.
실험 결과
연구 질문
- RQ12D 기반 가상 피팅 시스템은 다양한 자세에서 신원과 텍스처 디테일을 유지하면서도 옷을 효과적으로 이동시킬 수 있는가?
- RQ2인간 퍼싱에서 유도하는 고수준의 의미적 가이던스는 다자세 가상 피팅에서 정렬과 현실성 향상에 어떻게 기여하는가?
- RQ3포즈 인식 조합 마스크를 통합할 경우 생성된 이미지에서 디테일 복구와 아티팩트 억제에 얼마나 기여하는가?
- RQ4제안된 다단계 프레임워크는 다양한 자세와 의류 유형에서 시각적 품질과 일반화 능력 측면에서 SOTA 방법과 비교해 어떻게 성능을 냈는가?
주요 결과
- MPV 데이터셋에서 MG-VTON은 A/B 테스트에서 VITON 대비 83.1%, CP-VTON 대비 85.9%의 인간 선호도 점수를 기록하여 뛰어난 지각적 품질을 입증했다.
- DeepFashion에서 MG-VTON은 모든 기준선을 초월하여 VITON 대비 88.9%, CP-VTON 대비 84.6%의 선호도 점수를 기록하여 뛰어난 일반화 능력을 보였다.
- 절단 실험 결과, 다중 자세 조합 마스크 손실과 정밀도 보정 단계가 아티팩트 감소와 텍스처 정밀도 향상에 크게 기여함을 확인했다.
- 합성된 인간 퍼싱의 품질이 최종 생성된 이미지의 현실성과 직접적인 상관관계를 가지며, 이는 핵심 감독 신호로서의 역할을 검증한다.
- MPV에서 학습한 모델이 DeepFashion로 일반화되어도 높은 품질의 결과를 생성함을 확인했다.
- 정밀도 보정 단계(wo Render)나 조합 마스크(wo Mask)를 제거할 경우 성능 저하가 뚜렷하게 나타나, 이들이 디테일 복구에 핵심적인 역할을 한다는 점을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.