Skip to main content
QUICK REVIEW

[논문 리뷰] Compatible and Diverse Fashion Image Inpainting

Xintong Han, Zuxuan Wu|arXiv (Cornell University)|2019. 02. 04.
Generative Adversarial Networks and Image Synthesis참고 문헌 72인용 수 19
한 줄 요약

이 논문은 시각적 호환성과 다양성을 명시적으로 모델링하기 위해 형태와 외관 생성을 분리하는 두 단계 생성 프레임워크인 FiNET을 제안한다. 이중 인코더를 사용해 호환성 인식 잠재 코드를 학습함으로써, 기존 의류와 조화를 이룬 다양한 사진처럼 생긴 패션 아이템을 생성한다. DeepFashion에서 호환성, 다양성, 실사성 측면에서 이전 방법들을 능가한다.

ABSTRACT

Visual compatibility is critical for fashion analysis, yet is missing in existing fashion image synthesis systems. In this paper, we propose to explicitly model visual compatibility through fashion image inpainting. To this end, we present Fashion Inpainting Networks (FiNet), a two-stage image-to-image generation framework that is able to perform compatible and diverse inpainting. Disentangling the generation of shape and appearance to ensure photorealistic results, our framework consists of a shape generation network and an appearance generation network. More importantly, for each generation network, we introduce two encoders interacting with one another to learn latent code in a shared compatibility space. The latent representations are jointly optimized with the corresponding generation network to condition the synthesis process, encouraging a diverse set of generated results that are visually compatible with existing fashion garments. In addition, our framework is readily extended to clothing reconstruction and fashion transfer, with impressive results. Extensive experiments with comparisons with state-of-the-art approaches on fashion synthesis task quantitatively and qualitatively demonstrate the effectiveness of our method.

연구 동기 및 목표

  • 패션 이미지 합성에서 시각적 호환성 모델링의 부족을 해결하기 위해, 특히 다양한 의류가 조화를 이루는 방식으로 생성하는 데 초점한다.
  • 형태와 외관 생성을 분리함으로써 더 높은 사실감과 제어력을 확보하기 위한 두 단계 이미지 간 생성 프레임워크를 개발한다.
  • 공유된 잠재 공간을 사용해 의류 간 호환성을 명시적으로 모델링함으로써 생성된 아이템이 주변 의류와 조화를 이룰 수 있도록 보장한다.
  • 맥락에 시각적으로 호환되는 다양한 다중 모달 출력을 가능하게 하여 패션 추천 및 가상 시착과 같은 애플리케이션을 지원한다.
  • 이 프레임워크를 의류 복원 및 전이 작업으로 확장하여, 인painting을 넘어서 일반화 능력을 입증한다.

제안 방법

  • FiNET은 두 단계 아키텍처를 사용한다: 먼저 형상 마스크를 생성하고, 그 다음 형상에 기반해 외관을 합성한다.
  • 형상 생성 네트워크는 생성기와 두 개의 상호작용하는 인코더를 사용하여 이웃 의류로부터 호환성 있는 맥락을 조건으로 하는 잠재 코드를 학습한다.
  • 외관 생성 네트워크 역시 이중 인코더를 사용하여 사진처럼 생긴 질감을 생성하며, 잠재 코드는 호환성에 대해 공동 최적화된다.
  • 호환성 모듈은 하나의 인코더가 누락된 의류를, 다른 하나는 맥락 의류를 인코딩하는 공유된 잠재 공간을 사용하여 호환성 정규화를 가능하게 한다.
  • 잠재 표현은 생성기와 함께 최적화되어 합성 조건을 부여함으로써 다양성을 유지하면서도 호환성을 보존한다.
  • 목표 형상 및 외관 임베딩에 조건을 줌으로써 이 프레임워크는 의류 복원 및 전이 작업을 지원한다.

실험 결과

연구 질문

  • RQ1정답 호환성 애너테이션 없이 패션 이미지 생성에서 시각적 호환성을 어떻게 명시적으로 모델링할 수 있는가?
  • RQ2형태와 외관 생성을 분리함으로써 패션 인painting의 사실감과 다양성이 향상될 수 있는가?
  • RQ3주변 의류와의 호환성을 보장하면서도 다양한 다중 모달 출력을 어떻게 생성할 수 있는가?
  • RQ4기본 GAN 또는 VAE에 비해 호환성 인식 잠재 공간이 생성 품질을 얼마나 향상시킬 수 있는가?
  • RQ5이 프레임워크는 호환성과 다양성을 유지하면서도 의류 복원 및 전이와 같은 작업으로 확장될 수 있는가?

주요 결과

  • FiNET은 비교된 모든 방법 중에서 가장 높은 호환성 점수를 기록했으며, 호환성 유지를 실패하는 BicycleGAN 및 VUNET과 같은 베이스라인에 비해 뚜렷이 뛰어났다.
  • 사용자 연구에서 FiNET는 78.5%의 높은 인간 속임 성공률을 기록했으며, 이는 뛰어난 사실감을 시사한다. 반면 Inception Score는 인간 인식과 약한 상관관계를 보였다.
  • 호환성 인식 정규화가 없을 경우, BicycleGAN과 같은 방법은 매우 다양하지만 호환성이 떨어지는 출력을 생성함으로써 제안된 모듈의 필요성을 입증한다.
  • FiNET는 다양한 형태와 외관을 가진 질적 예시를 통해 맥락과 시각적으로 호환되는 다양한 다중 모달 결과를 생성한다.
  • 이 프레임워크는 의류 복원 및 전이 작업으로도 성공적으로 일반화되었으며, 두 작업 모두 자연스러운 결과를 생성했다.
  • LPIPS를 사용한 정량적 평가에서 FiNET는 높은 다양성(2,000개의 이미지 쌍 사용)을 입증했으며, 호환성은 512차원 임베딩 공간에서 코사인 유사도로 측정되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.