Skip to main content
QUICK REVIEW

[논문 리뷰] Two-stage Cascaded Classifier for Purchase Prediction

Sheikh Muhammad Sarwar, Mahamudul Hasan|arXiv (Cornell University)|2015. 08. 16.
Customer churn and segmentation인용 수 5
한 줄 요약

이 논문은 Adaboost.M1을 사용하여 구매 세션 탐지에서의 클래스 불균형 문제를 해결하고, Random Forest를 사용하여 아이템 예측을 수행하는 이단계 연쇄 분류기 기반 전자상거래 구매 예측 방법을 제안한다. 특성 선택 최적화 및 솔루션 파일 크기 제약을 고려함으로써 도전 과제 점수 45,027을 달성한다.

ABSTRACT

In this paper we describe our machine learning solution for the RecSys Challenge, 2015. We have proposed a time efficient two-stage cascaded classifier for the prediction of buy sessions and purchased items within such sessions. Based on the model, several interesting features found, and formation of our own test bed, we have achieved a reasonable score. Usage of Random Forests helps us to cope with the effect of the multiplicity of good models depending on varying subsets of features in the purchased items prediction and, in its turn, boosting is used as a suitable technique to overcome severe class imbalance of the buy-session prediction.

연구 동기 및 목표

  • 전용 구매 세션 비율이 5%에 불과한 전자상거래 클릭스트림 데이터에서 심각한 클래스 불균형 문제를 해결한다.
  • 구매 세션과 특정 구매 아이템을 모두 예측할 수 있는 확장성 있고 효율적인 이단계 모델을 개발한다.
  • 모델 성능과 25MB 솔루션 파일 크기 제약 조건을 균형 잡기 위해 특성 선택을 최적화한다.
  • 앙상블 학습 기법을 활용하여 세션 수준 및 아이템 수준 분류의 예측 정확도를 향상시킨다.
  • 실제 도전 과제 성능을 근사하고 모델 튜닝을 안내하기 위한 신뢰할 수 있는 테스트베드를 구축한다.

제안 방법

  • Weka 프레임워크의 Adaboost.M1을 활용하여 클래스 불균형에 강건한 특성으로 세션을 구매/비구매로 분류한다.
  • 연쇄 아키텍처를 적용: 먼저 Adaboost.M1로 잠재적 구매 세션을 식별하고, 그 다음 Random Forest로 특정 아이템을 예측한다.
  • 클릭 수, 아이템 빈도, 지속 시간, 시간대, 평균 클릭-구매 비율 등을 포함한 15개의 세션 수준 특성 추출.
  • 구매 세션 예측 작업에서의 클래스 불균형 문제를 완화하기 위해 리샘플링 기법을 적용한다.
  • 특성 조합을 최적화하여 모델 크기를 줄이고 25MB 제한 내 솔루션 파일 준수를 향상시킨다.
  • 도전 조건를 시뮬레이션하기 위해 자체 제작한 테스트베드에서 결과를 검증하고 하이퍼파라미터 튜닝을 안내한다.

실험 결과

연구 질문

  • RQ1어떻게 이단계 연쇄 분류기가 전자상거래 클릭스트림 데이터의 극심한 클래스 불균형 문제를 효과적으로 다룰 수 있는가?
  • RQ2저장소 제약 조건 하에서 어떤 세션 수준 특성 조합이 최고의 예측 성능을 낼 수 있는가?
  • RQ3Adaboost.M1을 사용할 경우 다른 지도 학습 모델에 비해 구매 세션 탐지 성능이 얼마나 향상되는가?
  • RQ4자체 제작한 테스트베드는 실제 도전 과제 성능을 정확하게 예측할 수 있는가?
  • RQ5RecSys Challenge 2015에서 특성 선택은 모델 정확도와 솔루션 파일 크기 간의 상호 보완적 관계에 어떻게 영향을 미치는가?

주요 결과

  • 이단계 연쇄 분류기는 최종적으로 도전 과제 점수 45,027점을 기록하였으며, 이는 테스트 세트에서 얻을 수 있는 최대 점수의 37%에 해당한다.
  • 선택된 특성을 사용한 Adaboost.M1는 테스트베드 점수 106,508.4점을 기록하였으며, 이는 실제 도전 과제 성능을 잘 근사하였다.
  • 시간 기반 및 집계 특성을 제외함으로써 정밀도는 향상되고 솔루션 크기는 감소하였지만, 재현율은 약간 하락하였다.
  • 모든 특성을 포함한 모델은 더 높은 점수(107,764)를 기록했지만, 25MB 솔루션 파일 크기 제한을 초과하여 제출에 부적합하였다.
  • Random Forest는 아이템 예측을 위한 다양한 우수한 특성 조합을 효과적으로 다루어, 다양한 특성 조합 간의 강건성을 확보하였다.
  • 자체 제작한 테스트베드는 실제 도전 과제 결과와 강한 상관관계를 보였으며, 신뢰할 수 있는 모델 튜닝과 평가를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.