Skip to main content
QUICK REVIEW

[논문 리뷰] Disentangled Cycle Consistency for Highly-realistic Virtual Try-On

Chongjian Ge, Yibing Song|arXiv (Cornell University)|2021. 03. 17.
Generative Adversarial Networks and Image Synthesis참고 문헌 45인용 수 4
한 줄 요약

이 논문은 가상 피팅을 세 가지 별개의 모듈—의복 워핑, 피부 합성, 이미지 조합—으로 분리하는 새로운 프레임워크인 분리된 사이클 일致성 피팅 네트워크(DCTON)를 제안한다. 이는 자기지도 학습 기반의 사이클 일치 학습을 통해 매우 현실적이며 사진 수준의 결과를 가능하게 한다. DCTON은 VITON에서 87.68%의 사용자 선호도를 기록하며 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성했으며, 19 FPS의 실시간 추론 속도를 확보했다.

ABSTRACT

Image virtual try-on replaces the clothes on a person image with a desired in-shop clothes image. It is challenging because the person and the in-shop clothes are unpaired. Existing methods formulate virtual try-on as either in-painting or cycle consistency. Both of these two formulations encourage the generation networks to reconstruct the input image in a self-supervised manner. However, existing methods do not differentiate clothing and non-clothing regions. A straight-forward generation impedes virtual try-on quality because of the heavily coupled image contents. In this paper, we propose a Disentangled Cycle-consistency Try-On Network (DCTON). The DCTON is able to produce highly-realistic try-on images by disentangling important components of virtual try-on including clothes warping, skin synthesis, and image composition. To this end, DCTON can be naturally trained in a self-supervised manner following cycle consistency learning. Extensive experiments on challenging benchmarks show that DCTON outperforms state-of-the-art approaches favorably.

연구 동기 및 목표

  • 기존의 가상 피팅 방법이 단방향 복원 또는 단순 사이클 일치에 의존함에 따라 텍스처 보존이 열악하고 이미지 콘텐츠 생성이 결합되어 있는 문제점을 해결하기 위해.
  • 의복 워핑, 피부 합성, 이미지 조합을 명시적으로 분리하여 별도로 학습 가능한 모듈로 구성함으로써 시각적 현실감과 구조적 정확성을 향상시키기 위해.
  • 사이클 일치를 통한 효과적인 자기지도 학습을 유지하면서도 소매, 칼라, 신체 부위와 같은 세밀한 디테일을 고도로 유지하는 것을 위해.
  • ACGPN 및 CP-VTON과 같은 이전 방법들에 비해 성능 향상과 계산 효율성을 확보한 엔드 투 엔드 학습을 달성하기 위해.

제안 방법

  • DCTON은 가상 피팅을 세 개의 하위 네트워크로 분해한다: 공간 변환 네트워크(STN)를 사용한 의복 워핑 모듈에 새로운 정규화 항목을 추가하여 텍스처 디테일을 보존한다.
  • 특정 인코더에서 제공하는 사전 특징을 기반으로, 가려진 영역(예: 팔, 흉부)에서 현실적인 인간의 피부를 생성하는 피부 합성 모듈을 도입한다.
  • 변형된 의복과 합성된 피부를 융합하여 최종 피팅 이미지를 생성하는 이미지 조합 모듈을 통해 전반적인 일관성과 현실적인 외관을 확보한다.
  • 전체 프레임워크는 사이클 일관성 방식으로 학습되며, 원본 의복이 있는 사람 이미지를 목표 의복으로 변환하고, 다시 원래 이미지를 복원함으로써 사이클을 닫는다. 이는 자기지도 학습을 가능하게 한다.
  • 콘텐츠 생성을 별개의 제어 가능한 구성 요소로 분리함으로써 상호 간섭을 줄이기 위해 분리된 사이클 일관성 손실을 사용한다.
  • STN에 정규화 항목을 추가하여 워핑의 안정성을 확보하고, 로고나 자수 무늬와 같은 세밀한 텍스처의 왜곡을 방지한다.
Figure 1: Comparison of virtual try-on pipelines. The inpainting methods (e.g., CP-VTON [ 35 ] and ACGPN [ 40 ] ) shown in the top row use one in-shop clothes to replace the same input clothes. The vanilla CycleGAN [ 18 ] shown in the middle row introduces two in-shop clothes for cycle consistency a
Figure 1: Comparison of virtual try-on pipelines. The inpainting methods (e.g., CP-VTON [ 35 ] and ACGPN [ 40 ] ) shown in the top row use one in-shop clothes to replace the same input clothes. The vanilla CycleGAN [ 18 ] shown in the middle row introduces two in-shop clothes for cycle consistency a

실험 결과

연구 질문

  • RQ1의복 워핑, 피부 합성, 이미지 조합으로 가상 피팅을 분리하면 생성된 피팅 이미지의 현실감과 품질이 향상되는가?
  • RQ2명시적인 분리 구조를 가진 사이클 일관성 학습 기반 방법이 단순 사이클 일치 또는 단방향 인painting에 비해 시각적 정확성과 디테일 보존 측면에서 우월한가?
  • RQ3제안된 방법은 팔, 소매, 로고와 같은 복잡한 영역에서의 잡음이나 이상 현상을 줄이며 높은 성능을 유지할 수 있는가?
  • RQ4전용 피부 합성 모듈의 포함 여부가 가려진 영역의 인간 피부의 현실감에 어떤 영향을 미치는가?
  • RQ5STN에 도입된 정규화 항목이 의복 워핑 과정에서 텍스처 보존에 얼마나 기여하는가?

주요 결과

  • DCTON은 VITON 테스트 세트에서 87.68%의 사용자 선호도 점수를 기록하여 CA-GAN(79.29%), CP-VTON(85.84%) 및 기타 최신 기술 수준 방법들을 크게 앞서며 성능을 뛰어넘었다.
  • 도전적인 VITON-HD 데이터셋에서 DCTON은 뛰어난 강건성과 일반화 능력을 보이며 기준 방법들에 비해 일관된 향상을 보였다.
  • 제거 실험 결과 피부 합성 인코더가 제거되면 피부가 흐릿하거나 색이 변하는 현상이 발생함을 확인하여, 이 모듈이 현실감 향상에 핵심적인 역할을 한다는 점을 입증했다.
  • STN에 정규화 항목이 없을 경우, 로고나 자수 무늬에 명백한 왜곡이 발생함을 확인하여, 이 정규화 항목이 세밀한 텍스처 보존에 필수적임을 입증했다.
  • 단일 V100 GPU에서 DCTON은 19 FPS의 추론 속도를 확보하여 ACGPN의 약 두 배에 가까운 속도를 기록했으며, FLOPs는 194G(ACGPN 대비 206G)로 약간 감소하고, 파rameter는 153M(ACGPN 대비 139M)로 略로 증가했다.
  • 학습 시간이 다소 길어(약 44시간 대비 약 40시간)졌지만, DCTON은 ACGPN 및 CP-VTON에 비해 더 높은 시각적 일관성과 더 적은 잡음으로 고품질 생성을 유지했다.
Figure 3: The pipeline of our disentangled cycle consistency framework. We show the CNN architecture above where there are clothes warping, skin synthesis, and image composition modules. The encoded features from these modules are concatenated to decode the output image. The cycle consistency is sho
Figure 3: The pipeline of our disentangled cycle consistency framework. We show the CNN architecture above where there are clothes warping, skin synthesis, and image composition modules. The encoded features from these modules are concatenated to decode the output image. The cycle consistency is sho

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.