Skip to main content
QUICK REVIEW

[논문 리뷰] Dress Code: High-Resolution Multi-Category Virtual Try-On

Davide Morelli, Matteo Fincato|arXiv (Cornell University)|2022. 04. 18.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

이 논문은 상의, 하의, 전체 신발 등 다양한 카테고리의 의류를 포함하는 고해상도(1024×768) 대규모 데이터셋인 Dress Code를 소개한다. 이를 통해 시각적 사실성과 세부 사항을 향상시키기 위해 픽셀 수준의 의미 인식 판별자(PSAD)를 제안한다. 이는 픽셀 수준에서 의미 일致성을 강제하여 가상 피팅 결과의 현실감과 세부 묘사 능력을 크게 향상시키며, 양적 평가 및 사용자 연구에서 기존 최고 수준의 방법들을 능가한다.

ABSTRACT

Image-based virtual try-on strives to transfer the appearance of a clothing item onto the image of a target person. Prior work focuses mainly on upper-body clothes (e.g. t-shirts, shirts, and tops) and neglects full-body or lower-body items. This shortcoming arises from a main factor: current publicly available datasets for image-based virtual try-on do not account for this variety, thus limiting progress in the field. To address this deficiency, we introduce Dress Code, which contains images of multi-category clothes. Dress Code is more than 3x larger than publicly available datasets for image-based virtual try-on and features high-resolution paired images (1024x768) with front-view, full-body reference models. To generate HD try-on images with high visual quality and rich in details, we propose to learn fine-grained discriminating features. Specifically, we leverage a semantic-aware discriminator that makes predictions at pixel-level instead of image- or patch-level. Extensive experimental evaluation demonstrates that the proposed approach surpasses the baselines and state-of-the-art competitors in terms of visual quality and quantitative results. The Dress Code dataset is publicly available at https://github.com/aimagelab/dress-code.

연구 동기 및 목표

  • 이미지 기반 가상 피팅을 위한 다양한 고해상도 데이터셋, 특히 하의 및 전체 신발 카테고리에 대한 부족을 보완하기 위해.
  • 신체 부위별로 의류를 정렬하는 방법을 학습함으로써 다수의 의류 카테고리를 처리할 수 있는 가상 피팅 프레임워크를 개발하기 위해.
  • 세분화된 의미 정보를 통한 감독을 통해 생성된 피팅 이미지의 시각적 품질과 현실감을 향상시키기 위해.
  • 다양한 의류 카테고리를 포함하는 새로운 공개 데이터셋을 활용해 종합적인 가상 피팅 벤치마크를 구축하기 위해.

제안 방법

  • 50,000개 이상의 고해상도(1024×768) 모델이 다양한 의류를 착용한 쌍체 이미지로 구성된 새로운 공개 데이터셋인 Dress Code를 제안한다.
  • 픽셀 수준에서 의미 분할과 진위 분류를 수행하는 픽셀 수준 의미 인식 판별자(PSAD)를 도입하여 현실감을 향상시킨다.
  • 의미 정보에 기반해 의류를 올바른 신체 부위에 정렬하는 코arse-to-fine 이미지 합성 네트워크를 훈련시킨다.
  • 파서 기반 판별자를 사용해 내부 의미 표현을 학습함으로써 생성된 이미지의 질감과 형태 일관성을 향상시킨다.
  • 정체성과 의류 세부 사항을 유지하기 위해 적대적 손실, 인지적 손실, L1 손실을 포함한 다단계 훈련 파이프라인을 활용한다.
  • 새로운 Dress Code 데이터셋과 표준 VITON 벤치마크 양쪽 모두에서 방법을 검증하였으며, 아블레이션 및 사용자 연구를 포함한다.

실험 결과

연구 질문

  • RQ1고해상도, 다중 카테고리 가상 피팅 데이터셋은 이미지 합성 모델의 일반화 능력과 현실감 향상에 기여하는가?
  • RQ2픽셀 수준의 의미 인식 판별자와 패치 수준 또는 이미지 수준의 판별자 간에 고해상도 피팅 이미지를 생성하는 데 있어 어떤 차이가 있는가?
  • RQ3통합 아키텍처가 상의, 하의, 전체 신발 등 다양한 의류 카테고리를 일관된 신체 정렬로 효과적으로 처리할 수 있는가?
  • RQ4제안된 방법이 양적 지표와 인간 평가 모두에서 기존 최고 수준의 모델을 얼마나 뛰어넘는가?

주요 결과

  • 제안된 PSAD 모델은 VITON 데이터셋에서 FID 13.71, KID 0.412를 기록하여 패치 기반 베이스라인(FID: 14.76, KID: 0.495) 및 CP-VTON+와 ACGPN과 같은 최고 수준의 모델들을 능가한다.
  • Dress Code 데이터셋에서 PSAD는 모든 해상도에서 패치 기반 베이스라인 대비 FID를 5.00점 향상시키고 KID를 0.46점 향상시켰다.
  • 사용자 연구 결과, PSAD 모델은 62.3%의 비교에서 더 현실적으로 평가되었으며, 입력 의류 및 모델과의 일관성이 더 높다고 64.1%에서 평가되었다.
  • VITON에서 PSAD 모델은 SSIM 0.885를 기록하여 CP-VTON+(0.828)와 ACGPN(0.845)을 모두 초월했으며, 더 나은 구조 보존 능력을 보였다.
  • 모든 해상도에서 일관된 성능 향상을 보이며, 256×192에서 1024×768까지의 범위에서 우수한 일반화 능력을 입증했다.
  • 상의와 하의 의류를 순차적으로 적용하는 다중 의류 피팅 설정이 Dress Code에서 성공적으로 구현되었으며, 이는 VITON에서 구현이 어려운 능력이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.