Skip to main content
QUICK REVIEW

[논문 리뷰] New Item Consumption Prediction Using Deep Learning

Michael Shekasta, Gilad Katz|arXiv (Cornell University)|2019. 05. 05.
Recommender Systems and Techniques참고 문헌 29인용 수 6
한 줄 요약

이 논문은 신규 아이템이 역사적 상호작용 데이터를 보유하지 않은 경우(냉시작 상황)에 세션 기반 추천 시스템에서 구매 의도를 예측하기 위한 딥러닝 기반의 콘텐츠 기반 방법인 PISA를 제안한다. 아이템 설명에서 유도된 워드 임베딩과 순환 신경망을 활용함으로써, PISA는 냉시작 설정에서 딥러닝 기반 베이스라인을 능가하며, 극도로 불균형한 데이터를 효과적으로 처리한다. 또한 협업 필터링 모델과 조합할 경우 성능 향상이 더욱 두드러진다.

ABSTRACT

Recommendation systems have become ubiquitous in today's online world and are an integral part of practically every e-commerce platform. While traditional recommender systems use customer history, this approach is not feasible in 'cold start' scenarios. Such scenarios include the need to produce recommendations for new or unregistered users and the introduction of new items. In this study, we present the Purchase Intent Session-bAsed (PISA) algorithm, a content-based algorithm for predicting the purchase intent for cold start session-based scenarios. Our approach employs deep learning techniques both for modeling the content and purchase intent prediction. Our experiments show that PISA outperforms a well-known deep learning baseline when new items are introduced. In addition, while content-based approaches often fail to perform well in highly imbalanced datasets, our approach successfully handles such cases. Finally, our experiments show that combining PISA with the baseline in non-cold start scenarios further improves performance.

연구 동기 및 목표

  • 신규 아이템이 역사적 상호작용 데이터를 보유하지 않은 경우(냉시작 상황) 세션 기반 추천 시스템에서 구매 의도를 예측하는 데 도전하는 것.
  • 사용자 이력에 의존하지 않고 아이템 설명과 임베딩을 활용해 아이템 간 관계를 모델링하는 콘텐츠 기반 접근법을 개발하는 것.
  • 실제 전자상거래 환경에서 흔한 극도로 불균형한 데이터셋에서의 성능 향상.
  • 다양한 제품 카테고리에 걸쳐 대규모 상용 데이터셋에서 본 방법의 효과성을 평가하는 것.
  • 기존의 협업 필터링 기반 베이스라인과의 통합을 통해 성능 향상을 도모하는 것.

제안 방법

  • PISA는 아이템 설명과 카테고리에 기반한 워드 임베딩을 사용해 아이템 간 의미적 관계를 모델링한다.
  • 시퀀스 기반 세션을 순환 신경망(RNN)을 통해 처리하여 시간적 의존성을 파악하고, 구매 가능성 확률을 예측한다.
  • 이진 교차 엔트로피 손실을 사용해 지도 학습 방식으로 엔드 투 엔드로 모델을 훈련하며, 세션이 구매로 끝날지 여부를 예측한다.
  • 사전 훈련된 임베딩을 활용해 아이템 간 지식을 전이함으로써, 새로운 미리보지 않은 아이템에 대한 일반화 능력을 향상시킨다.
  • 모델은 독립적으로 평가되며, 딥러닝 기반 협업 필터링 베이스라인과의 앙상블 방식으로도 평가된다.
  • 풍부한 콘텐츠 특징이 제공되는 바탕으로, 특히 드문 구매 이벤트에서도 신호를 확보함으로써 데이터 불균형에 강건한 설계가 되어 있다.

실험 결과

연구 질문

  • RQ1역사적 상호작용 데이터가 전혀 없는 신규 아이템이 포함된 세션 기반 시나리오에서 콘텐츠 기반 딥러닝 모델이 구매 의도를 효과적으로 예측할 수 있는가?
  • RQ2냉시작 설정에서 상태의 기반 딥러닝 협업 필터링 베이스라인과 비교해 PISA의 성능은 어떻게 되는가?
  • RQ3구매 이벤트가 비구매 행동에 비해 극도로 드문 불균형 데이터셋에서 PISA는 어느 정도 효과적으로 작동하는가?
  • RQ4PISA를 협업 필터링 베이스라인과 통합하면 비냉시작 상황에서 전체 성능이 향상되는가?
  • RQ5아이템 설명 길이, 카테고리별 데이터 양, 세션 클릭 패턴은 PISA의 예측 성능에 어떤 역할을 하는가?

주요 결과

  • PISA는 냉시작 설정에서 딥러닝 기반 베이스라인을 뚜렷한 성능 격차로 능가하며, 특히 50%의 세션이 신규 아이템을 포함할 경우 AUC 점수에서 뚜렷한 우위를 보인다.
  • 냉시작 아이템이 다수 포함된 상황에서 콘텐츠 기반 접근법이 베이스라인 및 통합 모델을 모두 능가함으로써, 새로운 아이템에 대한 강력한 일반화 능력을 입증한다.
  • PISA는 대부분의 추천 시스템이 어려움을 겪는 극도로 불균형한 데이터셋에서도 강력한 성능을 유지한다.
  • 더 긴 평균 아이템 설명 길이와 더 높은 아이템 수를 가진 제품 카테고리에서 성능이 뛰어나, 풍부한 텍스트 특징이 학습에 기여함을 시사한다.
  • 놀랍게도, 카테고리당 훈련 세션 수는 성능에 거의 영향을 주지 않아, 워드 임베딩을 통한 효과적인 카테고리 간 일반화가 이루어지고 있음을 나타낸다.
  • PISA를 협업 필터링 베이스라인과 통합하면 모든 시나리오에서 성능 향상이 이루어지며, 상호 보완적인 강점을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.