Skip to main content
QUICK REVIEW

[논문 리뷰] Snap and Find: Deep Discrete Cross-domain Garment Image Retrieval

Yadan Luo, Ziwei Wang|arXiv (Cornell University)|2019. 04. 05.
Advanced Image and Video Retrieval Techniques참고 문헌 31인용 수 4
한 줄 요약

이 논문은 순차적인 의류 속성과 주의 기반 시각적 특징을 학습하여 다중 도메인 의류 이미지 검색을 위한 연합 학습 프레임워크인 Deep Multi-task Cross-domain Hashing (DMCH)을 제안한다. 지도 학습이 필요한 랜드마크 애너테이션 없이 순차적 속성 학습을 통해 공간 주의를 유도함으로써, 최신 기술 대비 306배 빠른 추론 속도를 달성하면서도 DeepFashion 및 DARN 데이터셋에서 검색 정확도와 속성 예측 성능 모두에서 슈퍼리어한 성능을 보였다.

ABSTRACT

With the increasing number of online stores, there is a pressing need for intelligent search systems to understand the item photos snapped by customers and search against large-scale product databases to find their desired items. However, it is challenging for conventional retrieval systems to match up the item photos captured by customers and the ones officially released by stores, especially for garment images. To bridge the customer- and store- provided garment photos, existing studies have been widely exploiting the clothing attributes ( extit{e.g.,} black) and landmarks ( extit{e.g.,} collar) to learn a common embedding space for garment representations. Unfortunately they omit the sequential correlation of attributes and consume large quantity of human labors to label the landmarks. In this paper, we propose a deep multi-task cross-domain hashing termed extit{DMCH}, in which cross-domain embedding and sequential attribute learning are modeled simultaneously. Sequential attribute learning not only provides the semantic guidance for embedding, but also generates rich attention on discriminative local details ( extit{e.g.,} black buttons) of clothing items without requiring extra landmark labels. This leads to promising performance and 306$ imes$ boost on efficiency when compared with the state-of-the-art models, which is demonstrated through rigorous experiments on two public fashion datasets.

연구 동기 및 목표

  • 사용자가 촬영한 의류 이미지와 전문가가 촬영한 제품 이미지를 다중 도메인 검색 환경에서 매칭하는 데 도전하는 것.
  • 의류 속성을 순차적으로 모델링하여 시각적 주의에 대한 의미론적 가이던스를 제공함으로써 고비용의 랜드마크 애너테이션에 대한 의존도를 줄이는 것.
  • 고정된 128비트 이진 코드를 통해 검색 효율성을 향상시키면서도 높은 정확도를 유지하는 것.
  • 엔드 투 엔드 딥 러닝 프레임워크 내에서 다중 도메인 이미지 검색과 순차적 속성 예측을 공동 최적화하는 것.
  • 언어적으로 정렬된 순서에서 의류 속성 간 의미론적 상관관계를 포착함으로써 세밀한 차별화 능력을 향상시키는 것.

제안 방법

  • 다중 도메인 이미지 검색과 순차적 속성 예측을 동시에 학습하는 딥 다중 작업 학습 프레임워크를 제안한다.
  • 예를 들어 '검은색', '실크', '짧은 소매'와 같은 순서화된 속성의 시퀀스를 의미론적 지시자로 사용하여 컨볼루션 특징 내 공간 주의를 유도한다.
  • 유사한 의류 이미지 간의 유사도를 유지하기 위해 동일한 옷에 대한 사용자 도메인과 샵 도메인 이미지 간의 임베딩을 학습하기 위해 트리플릿 손실을 적용한다.
  • 사용자 및 샵 이미지에서 시각적 특징을 추출하기 위해 공유 백본을 가진 시아모이드 유사 네트워크 아키텍처를 활용한다.
  • 예측된 속성 순서에 기반하여 구분력 있는 국소 영역(예: 단추, 칼라)을 강조하는 주의 모듈을 도입한다.
  • 효율적인 해밍 공간 검색을 가능하게 하기 위해 이진 코드 길이를 128비트로 고정하여 쿼리 속도를 크게 향상시킨다.

실험 결과

연구 질문

  • RQ1수동 랜드마크 애너테이션 없이 순차적 의류 속성 모델링이 다중 도메인 의류 이미지 검색 성능 향상에 기여할 수 있는가?
  • RQ2순차적 속성 학습이 의류 이미지의 세밀한 시각적 세부 정보에 대한 주의를 어떻게 향상시키는가?
  • RQ3속성 예측과 이미지 검색을 공동으로 학습함으로써 검색 정확도와 효율성은 어느 정도 향상되는가?
  • RQ4검색 성능 및 계산 효율성 측면에서 최신 기술 대비 제안된 방법은 어떻게 비교되는가?
  • RQ5속성 순서의 언어적 정렬이 모델이 의미 있고 정확한 기술을 생성하는 데 어떤 영향을 미치는가?

주요 결과

  • DARN 데이터셋에서 DMCH는 ROUGE-L 점수 51.0을 기록했으며, 이는 DARN(32.5) 및 FashionNet(35.8)과 비교해 유의미하게 높은 성능이다.
  • DARN 데이터셋에서 DMCH는 CIDEr 점수 98.6을 기록했으며, FashionNet(76.5) 및 DARN(53.2)을 크게 뛰어넘어 우수한 순차적 속성 생성 능력을 입증했다.
  • 순차적 속성 학습을 통해 공간 주의를 유도함으로써 모델은 랜드마크 애너테이션 의존도를 감소시키며 검색 정확도를 향상시켰다.
  • 최신 기술 대비 306배 빠른 추론 효율성을 확보한 것은 압축된 128비트 이진 코드 덕분이었다.
  • 주의 시각화 결과는 모델이 소매, 칼라와 같은 구분력 있는 영역을 정확히 식별하고, '레이스'와 '레이싱'과 같은 속성 간 의미 관계를 유지함을 확인했다.
  • 임베딩 공간의 t-SNE 시각화 결과, 자세, 조명 또는 배경이 달라도 유사한 의류들이 군집되어 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.