Skip to main content
QUICK REVIEW

[논문 리뷰] M2E-Try On Net: Fashion from Model to Everyone

Zhonghua Wu, Guosheng Lin|arXiv (Cornell University)|2018. 11. 21.
Generative Adversarial Networks and Image Synthesis참고 문헌 30인용 수 21
한 줄 요약

M2E-Try On Net (M2E-TON)은 청소된 제품 이미지가 필요 없이 모델 이미지에서 사용자 사진으로 옷을 전송함으로써 사진 수준의 가상 피팅을 가능하게 한다. 세 가지 구성 요소인 포즈 정렬 네트워크(PAN), 텍스처 개선 네트워크(TRN), 피팅 네트워크(FTN)를 갖춘 자기지도 학습 및 쌍체-비쌍체 병행 학습 기반으로 포즈 정렬, 텍스처 향상, 옷의 자연스러운 피팅을 수행하여 사용자 평가에서 83.7%의 선호도를 기록하며 최신 기술 수준의 현실성 구현을 달성하였다.

ABSTRACT

Most existing virtual try-on applications require clean clothes images. Instead, we present a novel virtual Try-On network, M2E-Try On Net, which transfers the clothes from a model image to a person image without the need of any clean product images. To obtain a realistic image of person wearing the desired model clothes, we aim to solve the following challenges: 1) non-rigid nature of clothes - we need to align poses between the model and the user; 2) richness in textures of fashion items - preserving the fine details and characteristics of the clothes is critical for photo-realistic transfer; 3) variation of identity appearances - it is required to fit the desired model clothes to the person identity seamlessly. To tackle these challenges, we introduce three key components, including the pose alignment network (PAN), the texture refinement network (TRN) and the fitting network (FTN). Since it is unlikely to gather image pairs of input person image and desired output image (i.e. person wearing the desired clothes), our framework is trained in a self-supervised manner to gradually transfer the poses and textures of the model's clothes to the desired appearance. In the experiments, we verify on the Deep Fashion dataset and MVC dataset that our method can generate photo-realistic images for the person to try-on the model clothes. Furthermore, we explore the model capability for different fashion items, including both upper and lower garments.

연구 동기 및 목표

  • 청소된 제품 이미지가 없이도 모델 이미지와 사용자 이미지만을 사용하여 가상 피팅을 가능하게 한다.
  • 비강성 옷의 변형, 텍스처 유지, 정체성 외형 일관성 등의 과제를 해결한다.
  • 쌍체 데이터와 비쌍체 데이터를 활용하는 자기지도 학습 프레임워크를 개발하여 현실성 향상을 도모한다.
  • 세부 정보와 옷의 특징을 유지하는 사진 수준의 현실적인 피팅 결과를 생성한다.
  • 3D 데이터나 쌍체 애너테이션 없이도 전자상거래 및 소셜 미디어 분야에서 실용적인 가상 피팅 응용을 가능하게 한다.

제안 방법

  • 포즈 정렬 네트워크(PAN)는 조밀한 포즈 추정과 기하학적 왜곡을 이용해 모델의 포즈를 대상자와 일치시킨다.
  • 텍스처 개선 네트워크(TRN)는 포즈 조건부 GAN을 사용해 왜곡된 모델 이미지의 세부 정보, 로고, 텍스처를 향상시킨다.
  • 피팅 네트워크(FTN)는 개선된 옷을 대상자 이미지에 자연스럽게 블렌딩하면서 정체성과 신체 형태를 유지한다.
  • 비쌍체 데이터와 쌍체 데이터를 병행하는 새로운 비쌍체-쌍체 병행 학습 전략을 도입하여, 동일한 사람이 다른 포즈에서 찍힌 쌍체 이미지에 대한 자기지도 학습과 비쌍체 데이터에 대한 무 supervision 학습을 통합한다.
  • 포즈 조건부 GAN 판별기는 생성된 이미지와 대상 포즈 간의 불일치를 방지하기 위해 이를 벌점 처리함으로써 포즈 일관성을 강제한다.
  • 프레임워크는 청소된 제품 이미지가 전혀 필요 없이 모델 이미지와 대상자 이미지만을 입력으로 사용하여 엔드 투 엔드로 학습된다.

실험 결과

연구 질문

  • RQ1모델 이미지에서 직접 옷을 전송함으로써 청소된 제품 이미지가 없이도 가상 피팅을 구현할 수 있는가?
  • RQ2옷 전송 과정에서 모델과 사용자 간의 포즈 불일치 문제를 효과적으로 해결할 수 있는가?
  • RQ3로고 및 무늬와 같은 텍스처 세부 정보는 비강성 옷의 변형 동안 유지될 수 있는가?
  • RQ4쌍체 데이터가 부족한 상황에서 쌍체 이미지에 대한 자기지도 학습이 성능 향상에 기여하는가?
  • RQ5복잡한 옷 무늬에 대해 이 방법의 실패 유형은 무엇인가?

주요 결과

  • 제안된 M2E-TON은 사용자 평가에서 83.7%의 선호도를 기록하여 VITON(8.5%) 및 CP-VTON(7.0%)과 같은 기존 기반 모델들을 크게 앞서는 성능을 보였다.
  • PAN에 내장된 포즈 조건부 GAN은 표준 패치 GAN 대비 포즈 정렬을 효과적으로 수행하며 불일치 아티팩트를 감소시켰다.
  • TRN은 왜곡 후에도 로고와 세밀한 패턴을 효과적으로 유지하여 텍스처 충실도를 크게 향상시켰다.
  • 딥패션 및 MVC 데이터셋을 통한 검증 결과, 상의 및 하의를 포함한 다양한 패션 아이템에 대해 우수한 성능을 보였다.
  • 실패 케이스의 주요 원인은 모델 옷에 머리 무늬가 포함된 경우로, 네트워크가 이를 인간의 머리로 잘못 분류하는 경우가 빈번히 발생한다.
  • 비쌍체-쌍체 병행 학습 전략 덕분에 고도의 현실성 구현이 가능했으며, 비용이 많이 드는 쌍체 학습 데이터가 필요하지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.