Skip to main content
QUICK REVIEW

[논문 리뷰] A Comparison of Supervised Learning to Match Methods for Product Search

Fatemeh Sarvi, Nikos Voskarides|arXiv (Cornell University)|2020. 07. 20.
Web Data Mining and Analysis참고 문헌 39인용 수 4
한 줄 요약

이 논문은 제품 검색을 위한 12종의 지도 학습-매칭 방법을 평가하며, CIKM 2016(공개) 및 독점적인 유럽 전자상거래 데이터셋 두 개에서의 효과성과 효율성을 비교한다. 짧은 텍스트 매칭을 위해 설계된 모델들, 예를 들어 MV-LSTM 및 DRMMTKS는 일관되게 상위 3개 이내에 속하며, 실세계 구현에 가장 뛰어난 정확도와 효율성의 균형을 제공하는 것은 ARC-I이다. 놀랍게도, 사전 훈련 데이터의 도메인 불일치로 인해 최신 BERT 기반 모델은 성능이 떨어진다.

ABSTRACT

The vocabulary gap is a core challenge in information retrieval (IR). In e-commerce applications like product search, the vocabulary gap is reported to be a bigger challenge than in more traditional application areas in IR, such as news search or web search. As recent learning to match methods have made important advances in bridging the vocabulary gap for these traditional IR areas, we investigate their potential in the context of product search. In this paper we provide insights into using recent learning to match methods for product search. We compare both effectiveness and efficiency of these methods in a product search setting and analyze their performance on two product search datasets, with 50,000 queries each. One is an open dataset made available as part of a community benchmark activity at CIKM 2016. The other is a proprietary query log obtained from a European e-commerce platform. This comparison is conducted towards a better understanding of trade-offs in choosing a preferred model for this task. We find that (1) models that have been specifically designed for short text matching, like MV-LSTM and DRMMTKS, are consistently among the top three methods in all experiments; however, taking efficiency and accuracy into account at the same time, ARC-I is the preferred model for real world use cases; and (2) the performance from a state-of-the-art BERT-based model is mediocre, which we attribute to the fact that the text BERT is pre-trained on is very different from the text we have in product search. We also provide insights into factors that can influence model behavior for different types of query, such as the length of retrieved list, and query complexity, and discuss the implications of our findings for e-commerce practitioners, with respect to choosing a well performing method.

연구 동기 및 목표

  • 제품 검색 맥락에서 어휘 갭이 전통적인 정보 검색 작업보다 더 두드러진다는 점을 감안해 최근의 지도 학습-매칭 방법의 성능을 조사하는 것.
  • 12종의 학습-매칭 모델 간의 효과성(랭킹 품질)과 효율성(학습 및 추론 속도) 간의 상호 교환 관계를 평가하는 것.
  • 쿼리 특성(예: 길이 및 인기도)이 다양한 학습-매칭 모델의 성능에 미치는 영향을 이해하고, 전자상거래 플랫폼의 모델 선택을 안내하는 것.
  • 사전 훈련 도메인 불일치가 제품 검색에서 BERT 기반 모델에 미치는 영향을 평가하는 것. 여기서는 훈련 데이터가 일반 웹 텍스트와 크게 다름.
  • 실세계 구현 제약 조건과 쿼리 유형에 기반해 전자상거래 실무자들이 최적의 학습-매칭 모델을 선택하는 데 도움이 되는 실질적인 권고 사항을 제공하는 것.

제안 방법

  • 12종의 지도 학습-매칭 모델을 평가하며, MV-LSTM, DRMMTKS, DUET 및 BERT 기반 모델과 같은 신경망 아키텍처를 포함한다. 이들은 제품 쿼리와 상품 설명 간의 관련성 예측을 위해 훈련된다.
  • 주요 평가 지표로는 NDCG@5 및 NDCG@25를 사용하며, 두 데이터셋—공개된 CIKM 2016 벤치마크 데이터셋과 유럽 전자상거래 플랫폼의 독점적 쿼리 로그—에서 비교를 수행한다.
  • 쿼리 길이 및 인기도에 대한 분석을 통해 모델 간의 쿼리 의존적 성능 변동성을 규명하는 아블레이션 연구를 포함한다.
  • 효율성은 학습 및 추론 시간을 측정하여 평가하며, 특히 지연 시간 제약 조건이 있는 생산 시스템에서의 실용적 구현 가능성을 중점으로 한다.
  • semantic matching의 성능 향상을 정량화하기 위해 BM25와 같은 어휘 기반 베이스라인을 사용하며, 성능 향상률은 이 베이스라인 대비 백분율로 보고한다.
  • semantic matching가 lexical matching를 초월하거나 뒤지게 되는 쿼리에서의 모델 행동을 분석하여, 이러한 쿼리의 특성을 규명한다.

실험 결과

연구 질문

  • RQ1두 가지 다채로운 데이터셋에서 제품 검색 작업에 대해 다양한 지도 학습-매칭 모델의 효과성(NDCG@5 및 NDCG@25)은 어떻게 비교되는가?
  • RQ2실세계 전자상거래 환경에서 학습-매칭 방법의 효과성과 계산 효율성(학습 및 추론 시간) 간의 상호 교환 관계는 어떠한가?
  • RQ3쿼리 특성(예: 길이 및 인기도)이 다양한 학습-매칭 모델의 성능에 어떻게 영향을 미치는가?
  • RQ4최신 BERT 기반 모델이 다른 정보 검색 도메인에서는 뛰어난 성능을 보였음에도 불구하고, 제품 검색에서는 왜 성능이 떨어지는가?
  • RQ5실세계 전자상거래 플랫폼에 구현하기 위해 정확도, 효율성, 강건성의 최적 균형을 제공하는 학습-매칭 모델은 무엇인가?

주요 결과

  • CIKM 2016 데이터셋에서, 학습-매칭 방법은 BM25 어휘 기반 베이스라인 대비 NDCG@5를 최대 134.46% 향상시켰으며, 이는 어휘 일치도가 낮은 상황에서 semantic matching의 잠재력이 크다는 것을 시사한다.
  • 독점적 데이터셋에서는 성능 향상이 더 미약했으며(≤29.93%), 이는 쿼리와 상품 제목 간의 어휘 일치도가 높아져 semantic matching이 랭킹 향상에 기여할 여건이 줄었기 때문이다.
  • MV-LSTM 및 DRMMTKS는 두 데이터셋에서 일관되게 상위 3개 이내에 속하며, 제품 검색에서 짧은 텍스트 매칭에 강력한 강건성을 보여준다.
  • ARC-I는 실세계 구현에 가장 적합한 모델로 나타났다. 효과성, 효율성, 다양한 쿼리 유형 및 데이터셋 간 일관성 있는 성능의 최적 균형을 제공하기 때문이다.
  • BERT 기반 모델은 성능이 열악했으며, 저자들은 이는 사전 훈련 데이터(일반 웹 텍스트)와 짧고 키워드 중심이며 문장처럼 보이지 않는 제품 쿼리 및 제목 간의 불일치 때문이라고 분석한다.
  • 매우 큰 비율의 쿼리(50% 이상)가 semantic matching 덕분에 향상되었지만, 무시할 수 없는 일부는 성능이 악화되었으며, 이는 쿼리에 따라 모델을 선택하는 전략이 전체 성능 향상에 기여할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.