Skip to main content
QUICK REVIEW

[논문 리뷰] Searching for Apparel Products from Images in the Wild

Son N. Tran, Ming Du|arXiv (Cornell University)|2019. 07. 04.
Video Surveillance and Tracking Methods참고 문헌 22인용 수 4
한 줄 요약

이 논문은 YOLOv3 및 SSD 검출기를 사용하여 비구속적인 패션 이미지에서 의류 영역을 국소화하고, 다중 작업 컨볼루션 네트워크를 통해 세분화된 카테고리로 분류하며, 학습된 특징 임베딩을 사용해 온라인 카탈로그에서 시각적으로 유사한 품목을 검색하는 딥러닝 시스템을 제안한다. 색상 및 속성 예측을 통합함으로써 검색 정확도를 향상시키며, 인간 평가 결과 V1에서 V3 임베딩으로의 개선이 일관되게 관찰된다.

ABSTRACT

In this age of social media, people often look at what others are wearing. In particular, Instagram and Twitter influencers often provide images of themselves wearing different outfits and their followers are often inspired to buy similar clothes.We propose a system to automatically find the closest visually similar clothes in the online Catalog (street-to-shop searching). The problem is challenging since the original images are taken under different pose and lighting conditions. The system initially localizes high-level descriptive regions (top, bottom, wristwear. . . ) using multiple CNN detectors such as YOLO and SSD that are trained specifically for apparel domain. It then classifies these regions into more specific regions such as t-shirts, tunic or dresses. Finally, a feature embedding learned using a multi-task function is recovered for every item and then compared with corresponding items in the online Catalog database and ranked according to distance. We validate our approach component-wise using benchmark datasets and end-to-end using human evaluation.

연구 동기 및 목표

  • 소셜 미디어에 게시된 실제 환경의 패션 이미지에서 의류 품목에 대한 정확한 시각적 검색을 가능하게 하기 위해.
  • 비구속적인 자세, 조명, 가림, 다중 층의 의류 등으로 인한 의류 검출 과제를 해결하기 위해.
  • 제품 유형, 색상, 기타 속성을 캡처하는 구분 능력 있는 특징 임베딩을 학습함으로써 검색 정확도를 향상시키기 위해.
  • 인간 평가와 벤치마크 데이터셋을 사용하여 시스템을 종단 간 테스트로 검증하기 위해.
  • 세분화된 분류 모델의 특징을 활용하여 별도의 임베딩 네트워크 의존도를 줄이기 위해.

제안 방법

  • 의류 전용 데이터로 훈련된 YOLOv3 및 SSD 검출기를 사용하여 패션 이미지에서 고수준 영역(예: 상의, 하의, 손목 장식품 등)을 국소화하기 위해.
  • 제품 유형, 색상, 무늬, 소매 길이 등을 공동 학습하는 다층 계층의 다중 작업 컨볼루션 네트워크를 사용하여 검출된 영역을 146개의 세분화된 의류 카테고리로 분류하기 위해.
  • 쿼리 이미지와 카탈로그 품목의 양측에서 소프트맥스 이전의 최종 레이어에서 특징 임베딩을 추출하여 유사도 계산을 가능하게 하기 위해.
  • 유사도 비교를 동일한 세분화된 카테고리 내의 품목에 국한시켜 검색 일관성을 향상시키기 위해.
  • 훈련 중 배경 증강을 적용하여 임베딩이 배경 색상 간섭에 대해 강건해지도록 하기 위해.
  • MTurk를 통한 인간 평가를 통해 다양한 임베딩 버전(V1에서 V3) 간의 검색 품질을 비교하기 위해.

실험 결과

연구 질문

  • RQ1의류 전용 데이터로 훈련된 다중 박스 객체 검출기(예: OpenImages와 같은 일반 목적 검출기 대비)가 비구속적인 패션 이미지에서 의류 영역을 국소화하는 데 더 우수한 성능을 보일 수 있는가?
  • RQ2색상, 무늬, 소매 길이 등의 속성을 포함한 다중 작업 학습이 의류 검색을 위한 학습된 특징 임베딩의 품질을 어떻게 향상시키는가?
  • RQ3훈련 중에 배경 증강을 적용할 경우, 실제 이미지의 배경 혼잡함에 대한 임베딩의 강건성이 얼마나 향상되는가?
  • RQ4다양한 임베딩 버전(V1, V2, V3) 간의 종단 간 검색 성능은 인간 평가에서 어떻게 비교되는가?
  • RQ5세분화된 분류 네트워크가 별도의 거리 학습 단계 없이도 효과적인 종단 간 임베딩 추출기로 기능할 수 있는가?

주요 결과

  • 데이터 정제 및 다중 작업 학습을 거친 후 상의의 세분화된 분류 정확도가 V1의 0.52에서 V2의 0.80으로 향상되어 개선된 데이터와 공동 학습의 효과를 나타낸다.
  • 인간 평가 결과 V2는 V1보다 75%의 선호도를 보였으며, 색상 인식 임베딩이 검색 품질을 향상시킨다는 것을 입증한다.
  • V3는 V2보다 67%의 선호도를 보였으며, 다중 작업 네트워크에 추가로 13개의 분류 작업을 도입함으로써 일관된 성능 향상이 이루어졌음을 보여준다.
  • 실제 패션 이미지(예: 드레스의 경우 0.71 정확도)에서도 강력한 성능 유지를 유지하여 카탈로그 이미지 외부로의 일반화 능력이 우수함을 시사한다.
  • 단일 경계 상자 검출로 인한 다중 층의 상의 문제에도 불구하고 배경 증강을 통해 훈련한 결과 배경 색상에 대해 강건함을 보였다.
  • 세분화된 분류 네트워크에서 유도된 임베딩을 사용함으로써 별도의 거리 학습 네트워크가 필요 없어졌으며, 이는 파이프라인 단순화와 함께 높은 성능 유지에 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.