Skip to main content
QUICK REVIEW

[논문 리뷰] Ensemble Methods for Personalized E-Commerce Search Challenge at CIKM Cup 2016

Chen Wu, Ming Yan|arXiv (Cornell University)|2017. 08. 15.
Web Data Mining and Analysis참고 문헌 12인용 수 16
한 줄 요약

이 논문은 CIKM 컵 2016 도전 대회에서 개인화된 전자상거래 검색 순위 매기기 문제를 위한 스택드 앙상블 학습 방법을 제시한다. 이 방법은 통계적, 쿼리-아이템, 세션 수준의 특징을 다수의 모델—로지스틱 회귀, 기울기 부스팅 트리, RankSVM, 그리고 딥 매치 모델—과 함께 조합한 후 메타학습을 통한 스택킹을 적용하여 모든 평가 지표에서 최상의 성능을 달성하였다.

ABSTRACT

Personalized search has been a hot research topic for many years and has been widely used in e-commerce. This paper describes our solution to tackle the challenge of personalized e-commerce search at CIKM Cup 2016. The goal of this competition is to predict search relevance and re-rank the result items in SERP according to the personalized search, browsing and purchasing preferences. Based on a detailed analysis of the provided data, we extract three different types of features, i.e., statistic features, query-item features and session features. Different models are used on these features, including logistic regression, gradient boosted decision trees, rank svm and a novel deep match model. With the blending of multiple models, a stacking ensemble model is built to integrate the output of individual models and produce a more accurate prediction result. Based on these efforts, our solution won the champion of the competition on all the evaluation metrics.

연구 동기 및 목표

  • 사용자의 검색, 브라우징, 구매 행동을 기반으로 관련성 예측 및 아이템 재정렬을 통해 개인화된 전자상거래 검색 문제를 해결한다.
  • 학습-랭킹 기법을 활용하여 '쿼리-풀' 및 '쿼리-없음' 상황 모두에서 순위 매기기 성능을 향상시킨다.
  • 강력한 특징 공학 및 모델 앙상블을 통해 사용자 카테고리 간 데이터 희소성과 분포 이탈 문제를 해결한다.
  • 다양한 사용자 행동을 포함한 대규모 익명화된 전자상거래 데이터셋에서 최신 기술 수준의 성능을 달성한다.
  • 스택드 앙상블 방법이 다양한 모델을 조합하여 순위 매기기 작업에서 뛰어난 일반화 성능을 달성하는 데 효과적인지 입증한다.

제안 방법

  • 통계적 특징(예: 클릭률), 쿼리-아이템 특징(예: 어휘 일치도), 세션 수준 특징(예: 사용자 행동 시퀀스)의 세 가지 유형의 특징을 추출하였다.
  • 다양한 기초 모델을 훈련시켰다: 로지스틱 회귀(LR), 기울기 부스팅 결정 트리(GBDT), RankSVM, 그리고 의미적 매칭을 위한 새로운 딥 매치 모델(DMM).
  • 개별 모델의 예측 결과를 메타-학습기(GBDT)의 입력으로 사용하는 스택드 앙상블 프레임워크를 적용하여 최종 순위를 생성하였다.
  • '쿼리-없음' 상황에서는 검증 NDCG를 기반으로 각 카테고리별로 가장 성능이 좋은 LR 모델을 선택하는 모델 선택기 도입하였다.
  • 피드백 신호를 활용한 페어와이즈 학습을 통해 딥 매치 모델을 훈련시켜 쿼리-아이템 간 의미적 상호작용을 포착하였다.
  • 최종 점수를 '쿼리-풀'(80%) 및 '쿼리-없음'(20%) 상황의 NDCG 점수의 가중합으로 최적화하였다.

실험 결과

연구 질문

  • RQ1통계적, 쿼리-아이템, 세션 수준의 다양한 특징 유형을 효과적으로 조합하여 개인화된 검색 순위 매기기 성능을 향상시킬 수 있는가?
  • RQ2기존 모델(예: LR, GBDT)과 딥 러닝 모델(예: DMM) 간에 사용자 선호도를 포착하는 데 있어 상대적인 기여도는 어떠한가?
  • RQ3복잡한 실제 전자상거래 환경에서, 개별 모델보다 스택드 앙상블 학습이 순위 매기기 성능을 얼마나 향상시킬 수 있는가?
  • RQ4저자료 환경에서 카테고리별 자동 모델 선택이 어떻게 '쿼리-없음' 상황에서의 안정성을 유지하는 데 기여하는가?
  • RQ5이질적인 모델의 예측을 효과적으로 통합할 수 있는 메타-학습기가 '쿼리-풀' 및 '쿼리-없음' 설정 모두에서 단일 모델을 초월할 수 있는가?

주요 결과

  • 앙상블 모델은 검증 세트에서 최고의 NDCG 점수 0.4238을 기록하여 모든 개별 모델을 앞섰다.
  • 로지스틱 회귀 모델만으로도 단일 모델 중 최고 성능(NDCG = 0.4175)을 기록하여 다양한 특징 유형을 조합하는 데서의 강점을 보였다.
  • 딥 매치 모델(DMM)은 '쿼리-풀' 세트에서 NDCG 0.5077을 기록하여 제한된 데이터 속에서도 의미적 관련성 포착에 효과적임을 입증하였다.
  • 스택드 앙상블은 '쿼리-풀' 상황에서 NDCG를 0.5548로 향상시키고, '쿼리-없음' 상황에서는 0.3911로 개선하여 모델 간 상호보완성의 이점을 확인하였다.
  • '쿼리-없음' 상황에서의 모델 선택기는 각 카테고리별로 가장 높은 성능을 보이는 LR 모델을 성공적으로 선별하여 카테고리 기반 순위 정확도를 향상시켰다.
  • 최종 솔루션은 CIKM 컵 2016 대회에서 모든 평가 지표에서 1위를 차지하여 앙상블 접근 방식의 효과성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.