Skip to main content
QUICK REVIEW

[논문 리뷰] Modeling Product Search Relevance in e-Commerce

Rahul Radhakrishnan Iyer, Rohan Kohli|arXiv (Cornell University)|2020. 01. 14.
Web Data Mining and Analysis참고 문헌 27인용 수 4
한 줄 요약

이 논문은 자연어 처리 및 정보 검색 기법을 사용하여 전자상거래에서 제품 검색 관련성 예측을 위한 기계학습 접근법을 제안한다. 기존의 BM25 및 Indri와 같은 전통적 모델과 word2vec, sentence2vec, paragraph2vec와 같은 딥러닝 방법을 비교한 결과, word2vec가 홈 딜러리지 데이터셋에서 RMSE 0.2482와 상관계수 0.2687로 가장 뛰어난 성능을 보였다.

ABSTRACT

With the rapid growth of e-Commerce, online product search has emerged as a popular and effective paradigm for customers to find desired products and engage in online shopping. However, there is still a big gap between the products that customers really desire to purchase and relevance of products that are suggested in response to a query from the customer. In this paper, we propose a robust way of predicting relevance scores given a search query and a product, using techniques involving machine learning, natural language processing and information retrieval. We compare conventional information retrieval models such as BM25 and Indri with deep learning models such as word2vec, sentence2vec and paragraph2vec. We share some of our insights and findings from our experiments.

연구 동기 및 목표

  • 기계학습 및 자연어 처리 기법을 활용하여 전자상거래에서 제품 검색 관련성 예측을 향상시키기 위해.
  • 기존의 정보 검색 모델인 BM25 및 Indri와 비교하여 딥러닝 임bedding 기법인 word2vec, sentence2vec, paragraph2vec의 효과성을 평가하기 위해.
  • 다양한 모델을 조합함으로써 관련성 예측 정확도가 향상되는지 확인하기 위해.
  • 학습 데이터 크기가 검색 관련성 작업의 모델 성능에 미치는 영향을 분석하기 위해.
  • 어떤 딥러닝 모델이 맥락 이해 능력의 이론적 우위가 있음에도 불구하고 성능이 열등한 이유를 이해하기 위해.

제안 방법

  • 저자들은 카글에서 확보한 데이터셋을 사용하였으며, 이는 제품 ID, 검색 쿼리, 관련성 점수(1.0~3.0)를 포함한 총 74,067개의 학습 인스턴스로 구성되어 있다.
  • 제품 제목, 설명, 속성에서 유래한 텍스트 특징들은 소문자 변환, 불용어 제거, 어간 추출, n-gram 토크나이제이션을 통해 사전 처리된다.
  • 어휘에 없는 단어를 다루기 위해 레벤슈타인 거리 기반의 철자 수정 알고리즘이 적용된다.
  • word2vec, sentence2vec, paragraph2vec 모델이 구축되어 쿼리 및 제품에 대한 조밀한 벡터 표현을 생성한다.
  • 기본 모델(BM25, Indri)의 점수와 word2vec 유사도 점수를 SVM 분류기의 특징으로 조합한다.
  • 모델 성능 평가에는 예측된 관련성 점수와 실제 점수 간의 RMSE 및 상관계수를 사용한다.

실험 결과

연구 질문

  • RQ1word2vec과 같은 딥러닝 기반 단어 임베딩이 기존의 정보 검색 모델보다 전자상거래 제품 검색 관련성 예측 성능을 향상시킬 수 있는가?
  • RQ2문장 수준의 맥락 모델링 능력이 있는 sentence2vec 및 paragraph2vec 모델이 전자상거래 제품 설명에서 성능이 열등한 이유는 무엇인가?
  • RQ3BM25/Indri와 word2vec을 조합한 모델(예: SVM)이 통계적으로 유의미한 성능 향상을 가져오는가?
  • RQ4라벨이 부여된 학습 데이터의 크기가 관련성 예측 모델의 성능에 어떤 영향을 미치는가?
  • RQ5희소하고 비정형적인 제품 설명(예: 볼트 포인트)이 문장 수준 임베딩의 효과성에 제한을 미치는 역할은 무엇인가?

주요 결과

  • word2vec가 모든 모델 중에서 가장 뛰어난 성능을 보였으며, RMSE는 0.2482, 상관계수는 0.2687이었다.
  • sentence2vec 및 paragraph2vec 모델은 성능이 열등했으며, 각각 RMSE가 0.2748과 0.2706이었으며, 제품 설명의 문장 구조가 아닐 가능성이 높다.
  • SVM에 BM25/Indri 점수와 word2vec 유사도 점수를 조합한 결과 통계적으로 유의미한 성능 향상이 없었으며, 이는 특징 간의 비합리적 상관관계 때문일 수 있다.
  • 기본 모델(OR/AND 조합, BM25/Indri)은 RMSE 0.2509, 상관계수 0.2537를 기록했으며, word2vec에 비해 성능이 열등했다.
  • 학습 데이터가 증가할수록 성능 향상이 관찰되어, 더 많은 라벨이 부여된 예제가 훨씬 더 나은 결과를 이끌 수 있음을 시사한다.
  • word2vec 모델은 모호한 쿼리에 대해 효과적으로 관련성을 파악하여, 제품 검색 환경에서 의미적 유사성 처리에 뛰어난 강건성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.