Skip to main content
QUICK REVIEW

[논문 리뷰] Fashion Retrieval via Graph Reasoning Networks on a Similarity Pyramid

Zhanghui Kuang, Yiming Gao|arXiv (Cornell University)|2019. 08. 30.
Advanced Image and Video Retrieval Techniques참고 문헌 54인용 수 13
한 줄 요약

이 논문은 의류 이미지 간의 다중 척도 국소 및 전반적 유사성을 그래프로 표현한 유사성 피라미드로 모델링함으로써 패션 검색을 위한 그래프 추론 네트워크(GRNet)를 제안한다. 다양한 척도에서 노드 간 유사성에 대해 그래프 컨volutional 네트워크(GCN)를 적용하여 유의미한 의류 구성 요소의 정렬을 향상시키며, DeepFashion에서 26%의 top-1 정확도와 75%의 top-50 정확도를 기록하여 기존 방법보다 핵심 지표에서 10% 이상 향상된 최신 기준 성능을 달성한다.

ABSTRACT

Matching clothing images from customers and online shopping stores has rich applications in E-commerce. Existing algorithms encoded an image as a global feature vector and performed retrieval with the global representation. However, discriminative local information on clothes are submerged in this global representation, resulting in sub-optimal performance. To address this issue, we propose a novel Graph Reasoning Network (GRNet) on a Similarity Pyramid, which learns similarities between a query and a gallery cloth by using both global and local representations in multiple scales. The similarity pyramid is represented by a Graph of similarity, where nodes represent similarities between clothing components at different scales, and the final matching score is obtained by message passing along edges. In GRNet, graph reasoning is solved by training a graph convolutional network, enabling to align salient clothing components to improve clothing retrieval. To facilitate future researches, we introduce a new benchmark FindFashion, containing rich annotations of bounding boxes, views, occlusions, and cropping. Extensive experiments show that GRNet obtains new state-of-the-art results on two challenging benchmarks, e.g., pushing the top-1, top-20, and top-50 accuracies on DeepFashion to 26%, 64%, and 75% (i.e., 4%, 10%, and 10% absolute improvements), outperforming competitors with large margins. On FindFashion, GRNet achieves considerable improvements on all empirical settings.

연구 동기 및 목표

  • 로고나 무늬와 같은 구분 가능한 국소 세부 정보가 은폐되는 전반적 특징 표현의 한계를 해결하기 위해.
  • 가림, 자르기, 시점 변화와 같은 변형 상황에서도 전반적 및 국소 유사성을 공동으로 모델링함으로써 매칭의 강건성을 향상시키기 위해.
  • 다중 척도에서 적응적으로 유사성 점수를 개선하는 그래프 기반 추론 메커니즘을 개발하기 위해.
  • 가림, 자르기, 시점, 바운딩 박스 등에 대한 풍부한 애너테이션을 포함한 새로운 벤치마크인 FindFashion을 도입하여未래 연구를 지원하기 위해.

제안 방법

  • 다양한 척도에서 국소 및 전반적 이미지 영역 간의 유사성을 나타내는 노드로 구성된 유사성 피라미드를 구축하여 그래프 구조를 형성한다.
  • 질의 및 갤러리 이미지의 해당 이미지 패치 간 정규화된 유사성 점수로 각 노드를 표현한다.
  • 간선을 따라 메시지 전달을 수행하는 그래프 컨volutional 네트워크(GCN)를 적용하여 유사성 점수를 개선하는 상호 노드 추론을 가능하게 한다.
  • 동일 척도 내의 연결(Intra-scale connections)과 서로 다른 척도 간의 연결(Inter-scale connections)을 도입하여 특징 개선을 향상시킨다.
  • 다중 척도 특징 추출 전략을 CNN을 사용하여 다양한 해상도에서 영역 수준의 특징을 생성하여 유사성 계산에 활용한다.
  • 유사성 그래프에서 매칭 성능를 최적화하기 위해 대비 손실(contrastive loss)을 사용하여 GRNet을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1전반적 유사성 표현에 비해 의류 구성 요소 간의 다중 척도 유사성 모델링이 검색 정확도 향상에 기여하는가?
  • RQ2유사성 그래프 내의 인라인 스케일 및 인터 스케일 연결이 패션 검색 성능에 미치는 영향은 무엇인가?
  • RQ3유사성 피라미드에 대한 그래프 추론이 가림, 자르기, 시점 변화로 인한 성능 저하를 어느 정도 완화할 수 있는가?
  • RQ4제안된 GRNet이 하드 캡처나 가림과 같은 다양한 어려운 상황에서 잘 일반화되는가?
  • RQ5새로운 FindFashion 벤치마크는 현실적인 변형 상황에서의 검색 성능 평가 및 분석에 얼마나 효과적인가?

주요 결과

  • GRNet은 DeepFashion 벤치마크에서 26%의 top-1 정확도, 64%의 top-20 정확도, 75%의 top-50 정확도를 기록하여 이전 최신 기준 대비 각각 4%, 10%, 10%의 절대적 향상을 달성한다.
  • Street2Shop 벤치마크에서 GRNet은 상의, 드레스, 스커트, 바지, 아우터웨어의 다섯 가지 카테고리에서 모두 새로운 최신 기준 성능을 수립한다.
  • 제거 분석 결과 그래프 추론이 top-1 정확도에 11.6%의 절대적 향상을 기여하며, 인터 스케일 연결(+1.15%)과 인라인 스케일 연결(+0.9%)로 추가로 성능 향상이 이루어진다.
  • 스케일 수준이 증가함에 따라 GRNet은 일관된 성능 향상을 보이며, 2×2 및 3×3 구성에서 각각 73%의 top-50 정확도를 기록하여 다중 척도 모델링이 표현을 향상시킨다는 것을 시사한다.
  • 새로운 FindFashion 벤치마크에서 GRNet은 Easy 프로토콜에서 65.1%의 top-20 정확도, Hard-View에서 57.9%, Hard-Occlusion에서 35.0%, Hard-Cropping에서 48.4%의 정확도를 기록하여 KPM 및 베이스라인 모델을 모두 초월한다.
  • 모델은 하이퍼파rameter 선택에 대해 강건하며, 다양한 프로젝션 차원과 채널 수에서도 성능 저하가 없어 안정성과 일반화 능력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.