Skip to main content
QUICK REVIEW

[논문 리뷰] LGVTON: A Landmark Guided Approach to Virtual Try-On

Debapriya Basu Roy, Sanchayan Santra|arXiv (Cornell University)|2020. 04. 01.
Generative Adversarial Networks and Image Synthesis참고 문헌 47인용 수 7
한 줄 요약

LGVTON은 별도의 의류 이미지를 필요로 하지 않고 사람과 모델의 이미지만을 사용하여 모델의 옷을 입은 사람의 현실적인 이미지를 생성하는 랜드마크 기반 가상 피팅 기법을 제안한다. 이는 인간 및 패션 랜드마크를 사용하여 TPS 와핑 단계를 안내하고, 이후 마스크 생성기와 이미지 합성기 모듈을 통해 정밀도를 향상시킨다. MPV 및 DeepFashion 데이터셋에서 최신 기술 수준의 성능을 달성하며, FID 점수는 낮고 SSIM 점수는 높아져 우수한 결과를 보였다.

ABSTRACT

In this paper, we propose a Landmark Guided Virtual Try-On (LGVTON) method for clothes, which aims to solve the problem of clothing trials on e-commerce websites. Given the images of two people: a person and a model, it generates a rendition of the person wearing the clothes of the model. This is useful considering the fact that on most e-commerce websites images of only clothes are not usually available. We follow a three-stage approach to achieve our objective. In the first stage, LGVTON warps the clothes of the model using a Thin-Plate Spline (TPS) based transformation to fit the person. Unlike previous TPS-based methods, we use the landmarks (of human and clothes) to compute the TPS transformation. This enables the warping to work independently of the complex patterns, such as stripes, florals, and textures, present on the clothes. However, this computed warp may not always be very precise. We, therefore, further refine it in the subsequent stages with the help of a mask generator (Stage 2) and an image synthesizer (Stage 3) modules. The mask generator improves the fit of the warped clothes, and the image synthesizer ensures a realistic output. To tackle the problem of lack of paired training data, we resort to a self-supervised training strategy. Here paired data refers to the image pair of model and person wearing the same cloth. We compare LGVTON with four existing methods on two popular fashion datasets namely MPV and DeepFashion using two performance measures, FID (Fréchet Inception Distance) and SSIM (Structural Similarity Index). The proposed method in most cases outperforms the state-of-the-art methods.

연구 동기 및 목표

  • 가장 흔한 의류 이미지가 제공되지 않는 전자상거래 환경에서 가상 피팅 문제를 해결하기 위해, 모델과 사람의 이미지만을 기반으로 하는 방법을 제안한다.
  • 스트라이프나 플로럴 무늬와 같은 복잡한 무늬가 존재할 경우 기존 방법에서 성능 저하가 발생하는 문제를 해결하기 위해, 옷의 와핑 정확도를 향상시키는 데 목적이 있다.
  • 기존 TPS 기반 와핑 방법이 특징 매칭에 의존하여 옷의 세부 정보나 핏을 유지하지 못하는 한계를 극복한다.
  • 같은 옷을 착용한 모델-사람 쌍의 쌍화된 훈련 데이터가 부족한 문제를 해결하기 위해, 자기지도 학습 전략을 개발한다.
  • 와핑된 옷을 마스크 생성기와 이미지 합성기 모듈로 정밀화하여, 현실적이며 잡음 없는 가상 피팅 결과를 달성한다.

제안 방법

  • 관절 등의 인간 신체 랜드마크와 칼라, 허리선 등의 패션 랜드마크를 제어점으로 사용하여, 모델의 옷이 대상 사람의 몸매와 자세에 맞게 적합하도록 TPS 변환을 계산한다.
  • 랜드마크 대응 관계를 활용하여 초기 와핑된 옷 이미지를 생성하는 포즈 가이드 와핑 모듈(PGWM)을 적용하여, 스트라이프나 플로럴 무늬와 같은 복잡한 패atters에 대해 강건성을 확보한다.
  • 시계열 CNN 아키텍처를 기반으로 한 마스크 생성기 모듈(MGM)을 활용하여 와핑된 옷 마스크를 정밀화하고, 정렬을 향상시키며, 가림이나 변형을 효과적으로 처리한다.
  • GAN 기반 생성기와 패치 기반 판별기(patchGAN)를 갖춘 이미지 합성기 모듈(ISM)을 사용하여, 와핑된 옷과 대상 사람의 이미지를 조합하여 현실적이고 고해상도의 이미지를 합성한다.
  • 대상 사람의 파싱 마스크를 입력으로 사용하여, 대비 손실, L1 손실, DSSIM 손실을 포함한 자기지도 학습 전략을 통해 ISM을 훈련시켜 잡음 감소를 유도한다.
  • 시작 연결(skip connections)과 다중 척도 특징 학습을 시계열 네트워크에 통합하여 출력의 공간 이해력과 구조 일관성을 향상시킨다.

실험 결과

연구 질문

  • RQ1스트라이프나 플로럴 무늬와 같은 복잡한 패턴 하에서, 특징 매칭 기반 와핑 대비 랜드마크 기반 TPS 와핑이 의류의 세부 정보와 핏을 더 잘 유지할 수 있는가?
  • RQ2자기지도 학습 전략은 가상 피팅 작업에서 쌍화된 훈련 데이터 부족 문제를 어느 정도 완화할 수 있는가?
  • RQ3마스크 생성기와 이미지 합성기의 조합은 잡음 제거 및 현실감 향상에 얼마나 효과적인가?
  • RQ4인간 및 패션 랜드마크를 제어점으로 사용할 경우, 종래의 엔드 투 엔드 특징 매칭 대비 더 정확하고 일관성 있는 옷 와핑이 가능한가?
  • RQ5제안된 삼단계 프레임워크(와핑, 마스크 정밀화, 이미지 합성)는 MPV 및 DeepFashion과 같은 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • LGVTON은 MPV 및 DeepFashion 데이터셋에서 FID와 SSIM 측면에서 네 가지 최신 기술 수준의 방법보다 뛰어난 성능을 보였으며, 낮은 FID 점수는 더 높은 이미지 품질을, 높은 SSIM 점수는 더 뛰어난 구조 유사성을 의미한다.
  • 최종 출력에서 잡음이 크게 감소하였으며, 특히 이미지 합성기 모듈에 대상 마스크를 입력으로 사용할 경우 뚜렷하게 개선됨을 시각적 비교로 확인하였다. 이는 마스크가 없을 경우 잡음이 지속됨을 시사한다.
  • 랜드마크 기반 TPS 와핑 모듈은 옷의 무늬와 색상 정보를 효과적으로 유지하여, 특히 복잡한 패atters가 있는 의류에서 M2E-TON에서 관찰된 색상 및 무늬 열화 현상을 방지하였다.
  • 패션 랜드마크의 사용은 전통적인 기하학적 매칭 방법이 혼동할 수 있는 패턴(예: 셔츠의 머리 모양 패턴)이 있는 의류의 경우에도 정확한 와핑을 가능하게 하였다.
  • 마스크 생성기는 부분적인 가림이나 정렬 오류를 효과적으로 처리하여, 피팅 정확도를 향상시키고 눈에 띄는 테두리나 왜곡을 줄였다.
  • 자기지도 학습 전략은 쌍화된 데이터 없이도 효과적인 모델 훈련이 가능함을 보여주었으며, 비쌍화된 모델 및 사람 이미지로부터 학습 가능성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.