Skip to main content
QUICK REVIEW

[논문 리뷰] Style-Based Global Appearance Flow for Virtual Try-On

Sen He, Yi-Zhe Song|arXiv (Cornell University)|2022. 04. 03.
3D Shape Modeling and Analysis인용 수 9
한 줄 요약

이 논문은 가상 시착에 적합한 스타일 제너레이티브 어드바이저 기반의 글로벌 외형 흐름 추정 모델을 제안한다. 전역 스타일 벡터를 활용해 장거리 맥락을 포착하고, 큰 오차 정렬과 복잡한 자세에 대해 강건성을 향상시킨다. 지역 흐름 보정과 글로벌 스타일 모odulation을 결합함으로써, VITON 벤치마크에서 최신 기술 수준의 성능을 달성하였으며, SSIM은 0.91, FID는 8.89를 기록하였다.

ABSTRACT

Image-based virtual try-on aims to fit an in-shop garment into a clothed person image. To achieve this, a key step is garment warping which spatially aligns the target garment with the corresponding body parts in the person image. Prior methods typically adopt a local appearance flow estimation model. They are thus intrinsically susceptible to difficult body poses/occlusions and large mis-alignments between person and garment images (see Fig.~ ef{fig:fig1}). To overcome this limitation, a novel global appearance flow estimation model is proposed in this work. For the first time, a StyleGAN based architecture is adopted for appearance flow estimation. This enables us to take advantage of a global style vector to encode a whole-image context to cope with the aforementioned challenges. To guide the StyleGAN flow generator to pay more attention to local garment deformation, a flow refinement module is introduced to add local context. Experiment results on a popular virtual try-on benchmark show that our method achieves new state-of-the-art performance. It is particularly effective in a `in-the-wild' application scenario where the reference image is full-body resulting in a large mis-alignment with the garment image (Fig.~ ef{fig:fig1} Top). Code is available at: \url{https://github.com/SenHe/Flow-Style-VTON}.

연구 동기 및 목표

  • 큰 오차 정렬과 복잡한 자세 상황에서 국소 외형 흐름 추정의 한계를 해결한다.
  • 기존의 국소적 특징 대응에 의존하는 흐름 기반 방법이 전역 맥락을 부족하게 다루는 문제를 해결한다.
  • 전신 인물 이미지를 사용하는 '실세계' 상황에서도 강력한 의복 워핑을 가능하게 한다.
  • 국소 보정과 글로벌 스타일 모odulation을 통합하여 전역 맥락과 세밀한 변형 모델링 간의 균형을 이룬다.
  • 추론 시 인간 파싱을 요구하지 않고도 VITON 벤치마크에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 전체 이미지 맥락을 인코딩하기 위해 글로벌 스타일 벡터를 사용하는 스타일 제너레이티브 어드바이저 아키텍처 기반의 새로운 외형 흐름 추정 모듈을 제안한다.
  • 각 워핑 블록에서 스타일 모odulation(SM)을 사용하여 인물과 의복 이미지의 특징을 연결한 후, 글로벌 외형 흐름을 생성한다.
  • 국소 대응 기반의 흐름을 추정하는 지역 흐름 보정(RF) 모듈을 도입하여 세밀한 변형 모델링을 향상시킨다.
  • 글로벌 흐름 추정(SM)과 지역 보정(RF)을 스택형 워핑 블록 설계에 통합하여 정확도를 향상시킨다.
  • 실제 시착 결과의 현실성 확보를 위해 인지적 손실과 적대적 손실을 사용하여 모델을 엔드 투 엔드로 훈련시킨다.
  • 다중 해상도 특징 추출 전략을 활용하며, 저해상도 특징 맵에서 유도된 글로벌 스타일 벡터가 고해상도 흐름 예측을 안내한다.
Figure 2 : A schematic of our framework. The pre-trained parser based model $\mathcal{F}^{PB}$ generates an output image as the input of parser free model $\mathcal{F}$ . The two feature extractors in $\mathcal{F}$ extract the feature of person image and garment image, respectively. A style vector i
Figure 2 : A schematic of our framework. The pre-trained parser based model $\mathcal{F}^{PB}$ generates an output image as the input of parser free model $\mathcal{F}$ . The two feature extractors in $\mathcal{F}$ extract the feature of person image and garment image, respectively. A style vector i

실험 결과

연구 질문

  • RQ1스타일 제너레이티브 어드바이저 아키텍처에 내장된 글로벌 스타일 벡터가 인물과 의복 이미지 간의 큰 오차 정렬 상황에서 외형 흐름 추정 성능을 향상시키는가?
  • RQ2복잡한 자세와 가림 상황을 다룰 때 글로벌 스타일 모odulation은 국소 대응 기반의 흐름 추정보다 어떻게 비교되는가?
  • RQ3글로벌 스타일 모odulation과 지역 흐름 보정을 결합하면 개별 구성 요소보다 더 높은 성능을 낼 수 있는가?
  • RQ4제안된 방법은 전신 기준 이미지와 심한 공간적 오차 정렬이 존재하는 '실세계' 상황에 일반화 가능한가?
  • RQ5글로벌 흐름이 부족할 경우 지역 보정 모듈이 국소 변형 정확도 향상에 기여하는 정도는 어느 정도인가?

주요 결과

  • 제안된 방법은 표준 VITON 벤치마크에서 기존 방법을 능가하는 새로운 최신 기술 수준의 SSIM(0.91)과 FID(8.89)를 달성하였다.
  • 사람 평가 결과, 다음으로 우수한 방법(AF-PFN)과 비교했을 때 56.8%의 경우에서 선호되었으며, 강력한 시각적 품질을 입증하였다.
  • 제거 분석 결과, 스타일 모odulation(SM)과 지역 보정(RF)을 결합한 경우가 가장 뛰어난 성능(SIM: 0.91, FID: 8.89)을 기록하였으며, SM 전용(SIM: 0.89, FID: 9.84) 및 RF 전용(SIM: 0.89, FID: 10.73)보다 뛰어났다.
  • 큰 오차 정렬 상황에서도 모델의 강건성이 뚜렷하게 향상되었다: 인물 이미지가 수직으로 이동할 경우, 다른 방법들은 급격히 성능이 떨어지지만, 본 방법은 높은 성능를 유지하였다.
  • 확장된 VITON 데이터셋에서, 성능 저하가 최소 수준(ΔSSIM: 0.00, ΔFID: 1.02)으로 나타나, 강력한 일반화 및 강건성을 입증하였다.
  • 시각적 분석 결과, 특히 소매와 칼라와 같은 어려운 영역에서 지역 흐름을 정확하게 예측함을 확인하였으며, SM과 RF를 모두 사용했을 때 두드러진 성능 향상을 보였다.
Figure 3 : Qualitative results from different models (CP-VTON++ [ 26 ] , ACGPN [ 42 ] , PF-AFN [ 9 ] and ours) on VITON testing dataset.
Figure 3 : Qualitative results from different models (CP-VTON++ [ 26 ] , ACGPN [ 42 ] , PF-AFN [ 9 ] and ours) on VITON testing dataset.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.