Skip to main content
QUICK REVIEW

[논문 리뷰] $c^+$GAN: Complementary Fashion Item Recommendation

Sudhir Kumar, Mithun Das Gupta|arXiv (Cornell University)|2019. 06. 13.
Generative Adversarial Networks and Image Synthesis참고 문헌 31인용 수 16
한 줄 요약

이 논문은 웹에서 크롤링한 정렬되지 않은 패션 데이터를 사용하여 기준 상의(예: 셔츠)가 주어졌을 때 현실적이고 보완적인 패션 아이템(예: 바지)을 생성하는 조건부 생성 적대 신경망인 $c^{+}$ GAN을 제안한다. 생성기에서 평균 제곱오차(MSE) 손실과 진동수 도메인 변환(DCT) 계수를 통한 지각적 손실, 그리고 판별기에서 단순화된 렌즈링 기법을 통합함으로써 이미지 품질과 다양성을 향상시켰으며, 검색 엔진 기준 점수 81.25%와 다양성 점수 212.92를 달성하여 빙 쇼핑의 '잘 어울리는 아이템' 기능을 구동한다.

ABSTRACT

We present a conditional generative adversarial model to draw realistic samples from paired fashion clothing distribution and provide real samples to pair with arbitrary fashion units. More concretely, given an image of a shirt, obtained from a fashion magazine, a brochure or even any random click on ones phone, we draw realistic samples from a parameterized conditional distribution learned as a conditional generative adversarial network ($c^+$GAN) to generate the possible pants which can go with the shirt. We start with a classical cGAN model as proposed by Mirza and Osindero [arXiv:1411.1784] and modify both the generator and discriminator to work on captured-in-the-wild data with no human alignment. We gather a dataset from web crawled data, systematically develop a method which counters the problems inherent to such data, and finally present plausible results based on our technique. We propose simple ideas to evaluate how these techniques can conquer the cognitive gap that exists when arbitrary clothing articles need to be paired with another relevant article, based on similarity of search results.

연구 동기 및 목표

  • 정렬되지 않은 웹에서 캡처된 실생활 데이터를 바탕으로 상의(예: 셔츠)에 보완되는 하의(예: 바지)를 추천하는 문제를 해결하기 위해.
  • 사람이 수작업으로 정렬한 쌍이 필요 없이, 하의 $x$가 상의 $y$를 조건으로 하는 분포 $p(x|y)$를 학습하는 조건부 생성 모델을 개발하기 위해.
  • 기존의 정보 검색(IR) 방법을 초월하여 패션 아이템 추천의 생성 품질과 다양성을 향상시키기 위해.
  • 실생활 전자상거래 기능인 빙 쇼핑의 '잘 어울리는 아이템' 기능을 구동할 수 있는 구현 가능한 시스템을 만들기 위해.

제안 방법

  • 기존의 조건부 GAN(cGAN)을 확장하여, 실사 이미지와 생성 이미지의 DCT 계수를 기반으로 한 지각적 손실과 함께 평균 제곱오차(MSE) 손실을 포함한 다중 손실 생성기를 도입한다.
  • 학습 안정성 향상과 배치 간 모드 커버리지 향상을 위해 판별기에서 단순화된 렌즈링 기법을 적용한다.
  • 학습 중 모드 정규화를 강화하고 모드 붕괴를 감소시키기 위해 K-평균 클러스터링을 사용하여 패션 아이템을 그룹화한다.
  • 생성 샘플은 빙 이미지 검색을 통해 '청바지' 또는 '바지'를 검색하여 검색 엔진 기준 점수(SEC)로 평가한다.
  • 다양성은 생성 배치 간의 공동 채널 색상 히스토GRAM의 엔트로피로 측정되며, 높은 엔트로피는 더 큰 변동성을 의미한다.
  • 최종 모델은 적대적 손실, MSE, 지각적 손실, 그리고 렌즈링을 적용한 복원 손실(RLF) 체계를 함께 최적화하여 현실성과 다양성을 동시에 향상시킨다.

실험 결과

연구 질문

  • RQ1정렬되지 않은 웹에서 크롤링한 상의 이미지에 기반해 인간의 정렬 없이도 보완적인 패션 아이템(예: 바지)을 현실적으로 생성할 수 있는가?
  • RQ2지각적 손실과 복원 손실은 기존 GAN에 비해 생성된 패션 아이템의 현실성과 다양성에 어떻게 기여하는가?
  • RQ3판별기에서 단순화된 렌즈링 기법이 학습 안정성과 모드 커버리지 향상에 어떻게 기여하는가?
  • RQ4실생활 검색 엔진인 빙 이미지 검색을 통해 생성 샘플을 얼마나 정확히 검증할 수 있는가?
  • RQ5제안된 방법은 기존의 IR 기반 패션 추천 방식에 비해 더 다양한, 현실적인, 맥락적으로 타당한 옷 매칭을 생성할 수 있는가?

주요 결과

  • $c^{+}$ GAN 모델은 빙 이미지 검색을 통해 생성된 이미지 중 81.25%가 바지 또는 청바지로 정확히 식별되어 검색 엔진 기준 점수(SEC) 81.25%를 달성했다.
  • 다양성 점수(DC)는 212.92에 도달하여 생성 배치 간 높은 색상 변동성을 반영하며, 효과적인 모드 커버리지와 모드 붕괴 감소를 나타낸다.
  • 지각적 손실을 추가함으로써 다양성은 기존의 적대적 + MSE 모델의 164.85에서 193.62로 증가했으며, 높은 이미지 품질을 유지했다.
  • RLF 체계는 기본 적대적 모델 대비 SEC 및 DC 점수를 모두 향상시켜 학습 안정성 향상과 생성 품질 향상의 효과를 입증했다.
  • 모델는 미국 및 영국 시장에서 '티셔츠' 또는 '스웨트셔츠'와 같은 쿼리에 대해 빙 쇼핑의 '잘 어울리는 아이템' 기능을 성공적으로 구동하고 있다.
  • 이 방법은 기존의 IR 기반 접근 방식에 비해, 심지어 미리보지 않은 입력 이미지에 대해서도 다양한, 현실적인, 맥락적으로 타당한 옷 매칭을 생성하는 데에 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.