Skip to main content
QUICK REVIEW

[논문 리뷰] Retrieving Similar E-Commerce Images Using Deep Learning

Rishab Sharma, Anirudha Vishvakarma|arXiv (Cornell University)|2019. 01. 11.
Advanced Image and Video Retrieval Techniques참고 문헌 32인용 수 9
한 줄 요약

이 논문은 전자상거래 이미지에서 미세한 시각적 유사성을 포착하기 위해 4096차원 이미지 임베딩을 학습하는 시아모프(Siamese) 딥 컨volution 신경망인 RankNet을 제안한다. 새로운 분수 거리 행렬과 각도 손실 함수를 사용함으로써 기존 방법과 최신 모델을 능가하며, Street2Shop 데이터셋에서 94.98%의 정확도와 88.576%의 상위 20개 검색 정확도를 달성한다.

ABSTRACT

In this paper, we propose a deep convolutional neural network for learning the embeddings of images in order to capture the notion of visual similarity. We present a deep siamese architecture that when trained on positive and negative pairs of images learn an embedding that accurately approximates the ranking of images in order of visual similarity notion. We also implement a novel loss calculation method using an angular loss metrics based on the problems requirement. The final embedding of the image is combined representation of the lower and top-level embeddings. We used fractional distance matrix to calculate the distance between the learned embeddings in n-dimensional space. In the end, we compare our architecture with other existing deep architecture and go on to demonstrate the superiority of our solution in terms of image retrieval by testing the architecture on four datasets. We also show how our suggested network is better than the other traditional deep CNNs used for capturing fine-grained image similarities by learning an optimum embedding.

연구 동기 및 목표

  • 패션 의류와 같은 미세한 카테고리에서 시각적으로 유사한 전자상거래 제품을 검색하는 데 도전하는 것.
  • 패턴과 질감과 같은 미세한 시각적 차이를 포착하지 못하는 수작업 특징(예: SIFT, HOG)의 한계를 극복하는 것.
  • 감독형 대비 학습을 통해 강력하고 계층적인 이미지 임베딩을 학습하여 이미지 검색 성능을 향상시키는 것.
  • 사용자 업로드 이미지에서 검색하는 시각적 검색과 카탈로그 내에서 추천하는 시각적 추천을 위한 통합 프레임워크를 개발하는 것.

제안 방법

  • ImageNet에서 사전 훈련된 VGG19를 기반으로 다중 스케일 시아모프 CNN 아키텍처를 사용하여 4096차원 이미지 임베딩을 학습한다.
  • 기존의 유클리드 거리 대신 더 나은 근접도 추정을 위해 n차원 공간 내 임베딩 간 거리를 계산하는 데 사용되는 새로운 분수 거리 행렬을 설계한다.
  • 음성 쌍 간의 마진을 최대화하고 양성 쌍 간의 마진을 최소화함으로써 네트워크를 최적화하기 위해 각도 손실 함수를 도입한다.
  • 훈련 중에 고품질의 양성 및 음성 이미지 쌍을 선택하기 위해 교육 과정 학습 기반의 쌍 샘플링 전략을 구현한다.
  • 과적합을 방지하기 위해 데이터 증강과 드롭아웃을 적용하였으며, 사전 훈련된 VGG19의 상단 두 개의 합성곱 레이어만 미세조정하였다.
  • 학습된 임베딩 공간을 시각화하기 위해 t-SNE를 사용하여 의미적으로 유사한 이미지가 함께 군집되어 있음을 확인하였다.

실험 결과

연구 질문

  • RQ1분수 거리 행렬을 사용한 시아모프 CNN이 전자상거래 이미지의 시각적 유사성 측정에서 기존의 유클리드 거리보다 우수한 성능을 보일 수 있는가?
  • RQ2기본 대비 손실 함수에 비해 각도 손실 함수가 미세한 시각적 유사성 학습에 더 나은 성능을 보이는가?
  • RQ3수작업 특징 방법(예: SIFT, HOG)과 다른 딥 러닝 기반 모델에 비해 제안된 RankNet 모델의 이미지 검색 정확도는 어떻게 되는가?
  • RQ4다중 스케일 특징 학습은 제품 이미지에서 미세한 시각적 차이를 구분하는 능력을 얼마나 향상시키는가?
  • RQ5작은 또는 불균형한 데이터셋에서 모델이 다양한 전자상거래 데이터셋에 잘 일반화되어 상위 20개 검색에서 높은 정확도를 유지할 수 있는가?

주요 결과

  • RankNet은 Street2Shop 데이터셋에서 검증 정확도 94.98%를 기록하여 AlexNet 기준(90.8%)과 VisNet(93.39%)를 크게 앞서며 뛰어난 성능을 보였다.
  • RankNet은 Street2Shop 테스트 세트에서 상위 20개 검색 정확도 88.576%를 달성하여 AlexNet 기준(14.400%)을 크게 뛰어넘었으며, VisNet(87.914%)와도 유사한 성능을 보였다.
  • 임베딩 공간의 t-SNE 시각화 결과, 같은 카테고리에 属하는 이미지들이 함께 군집되어 있음을 확인하여 효과적인 의미적 군집화가 이루어졌음을 입증하였다.
  • 분수 거리 행렬의 사용은 근접도 기반의 이미지 순서 정렬 성능을 향상시켜 미세한 시각적 유사성을 보다 우수하게 포착할 수 있음을 입증하였다.
  • 각도 손실과 교육 과정 기반의 쌍 샘플링 전략의 조합은 특히 소규모 또는 불균형 데이터셋에서 빠른 수렴과 더 나은 일반화 성능을 이끌어냈다.
  • 사전 훈련된 VGG19의 상단 두 레이어만 미세조정하면서 데이터 증강과 드롭아웃을 적용함으로써 과적합을 효과적으로 방지하고 모델의 강건성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.