Skip to main content
QUICK REVIEW

[논문 리뷰] Toward Characteristic-Preserving Image-based Virtual Try-On Network

Bochao Wang, Huabin Zheng|arXiv (Cornell University)|2018. 07. 20.
Generative Adversarial Networks and Image Synthesis참고 문헌 27인용 수 11
한 줄 요약

이 논문은 큰 공간적 변형 동안 옷의 핵심 특징(예: 질감, 로고)을 유지하는 완전히 학습 가능한 이미지 기반 가상 시도 네트워크인 CP-VTON을 제안한다. 학습 가능한 투명판 스플라인 변환을 사용하는 기하학적 매칭 모듈과 시도 모듈 내의 조합 마스크를 통해 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Image-based virtual try-on systems for fitting new in-shop clothes into a person image have attracted increasing research attention, yet is still challenging. A desirable pipeline should not only transform the target clothes into the most fitting shape seamlessly but also preserve well the clothes identity in the generated image, that is, the key characteristics (e.g. texture, logo, embroidery) that depict the original clothes. However, previous image-conditioned generation works fail to meet these critical requirements towards the plausible virtual try-on performance since they fail to handle large spatial misalignment between the input image and target clothes. Prior work explicitly tackled spatial deformation using shape context matching, but failed to preserve clothing details due to its coarse-to-fine strategy. In this work, we propose a new fully-learnable Characteristic-Preserving Virtual Try-On Network(CP-VTON) for addressing all real-world challenges in this task. First, CP-VTON learns a thin-plate spline transformation for transforming the in-shop clothes into fitting the body shape of the target person via a new Geometric Matching Module (GMM) rather than computing correspondences of interest points as prior works did. Second, to alleviate boundary artifacts of warped clothes and make the results more realistic, we employ a Try-On Module that learns a composition mask to integrate the warped clothes and the rendered image to ensure smoothness. Extensive experiments on a fashion dataset demonstrate our CP-VTON achieves the state-of-the-art virtual try-on performance both qualitatively and quantitatively.

연구 동기 및 목표

  • 이미지 기반 가상 시도에서 큰 공간적 변형 동안 세밀한 옷의 특징(예: 질감, 로고)을 유지하는 데 도전한다.
  • 이전 방법들이 수작업으로 만든 형태의 맥락 매칭에 의존하고, 굵은-세밀한 전략으로 인해 세부 사항 손실이 발생하는 한계를 극복한다.
  • 완전히 엔드 투 엔드로 학습 가능한 파이프라인을 개발하여, 상점의 옷을 대상 인물의 체형에 정렬하면서 외관의 정밀도를 유지한다.
  • 기존 방법에서 흔히 발생하는 입력의 경미한 비정렬에 대한 강건성을 향상시킨다.

제안 방법

  • 수작업으로 만든 형태의 맥락 매칭을 대체하기 위해, 대상 인물의 체형에 상점 옷을 정렬하는 데 투명판 스플라인 변환을 예측하는 학습 가능한 기하학적 매칭 모듈(Geometric Matching Module, GMM)을 도입한다.
  • 포즈에 일관된 이미지를 생성하고, 변형된 옷과 렌더링된 인물 이미지를 유연하게 융합하기 위해 U-Net 기반의 시도 모듈을 활용한다.
  • L1 정규화를 사용하여 조합 마스크를 학습시켜 변형된 옷과 U-Net 렌더링 이미지 간의 기여도를 균형 있게 조절하며, 초기 학습 단계에서는 변형된 옷 측면을 우선시하여 세부 사항을 유지한다.
  • 두 단계 학습 전략을 활용한다: 첫 번째로 GMM이 옷을 인물의 체형에 정렬하도록 학습하고, 두 번째로 시도 모듈이 조합 마스크를 사용하여 정렬된 옷과 인물 이미지를 융합한다.
  • 최종 출력의 현실성과 세부 사항 정밀도를 향상시키기 위해 L1, 인지적, 적대적 손실을 조합한 손실 함수를 활용한다.
  • 새로운 학습 스케줄을 도입하여, 초기에는 조합 마스크가 변형된 옷 측면을 우선시하도록 하여 네트워크가 세부 사항을 유지하는 데 먼저 학습하도록 하고, 점차 U-Net 렌더링 영역으로 점차 적응하도록 한다.

실험 결과

연구 질문

  • RQ1큰 공간적 변형 하에서, 완전히 학습 가능한 기하학적 변환 모듈이 수작업으로 만든 형태의 맥락 매칭보다 상점 옷을 대상 인물의 체형에 정렬하는 데 더 우수한 성능을 보일 수 있는가?
  • RQ2학습 가능한 조합 마스크를 사용할 경우, 직접 융합하거나 고정된 융합 전략에 비해 옷의 특징 유지에 더 유리한가?
  • RQ3특히 기존의 이중 단계 파이프라인(VITON 등)과 비교할 때, 입력의 경미한 비정렬에 대해 제안된 방법은 얼마나 강건한가?
  • RQ4어려운 자세 및 체형 변화 조건 하에서도, 로고, 텍스트, 질감과 같은 세밀한 옷의 세부 사항을 어느 정도 유지할 수 있는가?

주요 결과

  • CP-VTON은 한 등재 [10]의 패션 데이터셋에서 정성적·정량적으로 최신 기술 수준의 성능을 달성하여, VITON 및 기타 기준 모델을 능가하며 옷의 특징을 잘 유지한다.
  • 절단 실험 결과, 조합 마스크를 제거할 경우 경미한 비정렬 조건에서도 뿌연 결과가 발생함을 확인하여, 이 마스크가 세부 사항 유지에 핵심적인 역할을 한다는 것을 입증한다.
  • 조합 마스크에 대한 L1 정규화는 필수적이다. 이 정규화가 없을 경우 마스크는 U-Net 렌더링 이미지 측면을 우선시하게 되어 옷의 세부 사항이 손실된다.
  • CP-VTON은 시뮬레이션된 비정렬(최대 20픽셀 이격)에 대해 뛰어난 강건성을 보이며, 증가하는 왜곡 조건 하에서 VITON이나 CP-VTON(w/o mask)보다 성능 저하가 더 느리게 발생한다.
  • 실패 사례 분석을 통해 드문 자세, 내부 옷의 모호성, 오래된 옷의 왜곡된 형태 처리에 대한 한계를 확인하였으며, 이는 형태 인식 모델링 향상 여지가 있음을 시사한다.
  • qualitative 비교 결과, 로고 및 질감과 같은 고정밀 세부 사항이 효과적으로 유지됨을 확인하였으며, 최종 시도 결과에서 왜곡이나 아티팩트가 최소한으로 발생한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.