Skip to main content
QUICK REVIEW

[논문 리뷰] Large Scale Purchase Prediction with Historical User Actions on B2C Online Retail Platform

Yuyu Zhang, Liang Pang|arXiv (Cornell University)|2014. 08. 27.
Human Mobility and Location-Based Analysis인용 수 9
한 줄 요약

이 논문은 Tmall B2C 플랫폼에서 5억 5천만 건이 넘는 사용자 행동 기록을 활용하여 대규모 구매 예측을 위한 이단계 기계학습 접근법을 제시한다. 기울기 부스팅 회귀 트리, 로지스틱 회귀, 랜덤 포레스트 및 글로벌 스코링 모델을 조합하여 선형 회귀와 앙상블을 통해 F₁ 스코어 0.0611을 달성하였으며, Tmall 추천 경진대회 2014에서 7,276개 팀 중 7위를 기록하였다.

ABSTRACT

This paper describes the solution of Bazinga Team for Tmall Recommendation Prize 2014. With real-world user action data provided by Tmall, one of the largest B2C online retail platforms in China, this competition requires to predict future user purchases on Tmall website. Predictions are judged on F1Score, which considers both precision and recall for fair evaluation. The data set provided by Tmall contains more than half billion action records from over ten million distinct users. Such massive data volume poses a big challenge, and drives competitors to write every single program in MapReduce fashion and run it on distributed cluster. We model the purchase prediction problem as standard machine learning problem, and mainly employ regression and classification methods as single models. Individual models are then aggregated in a two-stage approach, using linear regression for blending, and finally a linear ensemble of blended models. The competition is approaching the end but still in running during writing this paper. In the end, our team achieves F1Score 6.11 and ranks 7th (out of 7,276 teams in total).

연구 동기 및 목표

  • 대규모 사용자 행동 데이터를 보유한 B2C 전자상거래 플랫폼에서 대규모 구매 예측 문제에 도전하기 위해.
  • 분산 환경에서 5억 5천만 건 이상의 행동 기록을 처리할 수 있는 견고하고 확장 가능한 기계학습 파이프라인을 개발하기 위해.
  • 이중 단계의 혼합 및 앙상블 전략을 통해 다수의 모델을 융합하여 예측 성능을 향상시키기 위해.
  • 사용자 의도와 브랜드 애자성의 시간에 따른 변화를 포착하는 효과적인 시간적 및 행동 특징을 설계하기 위해.
  • 명시적인 훈련/테스트 분할 없이 실제 추천 환경에서 정밀도와 재현율을 균형 있게 유지하기 위해 F₁ 스코어 최적화를 위해.

제안 방법

  • 재귀, 분류 및 글로벌 스코링 모델을 사용하여 표준 기계학습 문제로 구매 예측을 모델링하기 위해.
  • 고정 및 슬라이딩 시간 간격을 활용한 시간에 따라 달라지는 특징 공학을 적용하여 사용자 행동의 역학을 포착하기 위해.
  • 사용자, 브랜드 및 쌍 수준의 행동 기반으로 수량, 비율, 플래그 및 글로벌 특징을 포함한 포괄적인 특징 세트를 설계하기 위해.
  • 개별 모델 예측을 그룹 단위로 혼합하기 위해 로지스틱 회귀를 사용하여 과적합을 줄이고 일반화 성능을 향상시키기 위해.
  • 혼합된 모델의 선형 앙상블을 적용하여 추가로 예측 정확도를 향상시키기 위해.
  • 모델의 강건성을 향상시키기 위해 규칙 기반 인사이트를 직접 예측값으로 추가하는 대신 이진 플래그 특징으로 통합하기 위해.

실험 결과

연구 질문

  • RQ1B2C 전자상거래 플랫폼에서 5억 5천만 건 이상의 사용자 행동 기록을 처리할 수 있는 확장 가능한 기계학습 파이프라인을 어떻게 설계할 수 있는가?
  • RQ2사용자 의도와 브랜드 애자성을 햖थ한 향후 구매 예측에 가장 효과적인 특징 공학 전략은 무엇인가?
  • RQ3이중 단계의 모델 혼합 및 앙상블 접근 방식은 개별 모델 대비 F₁ 스코어를 어떻게 향상시키는가?
  • RQ4사용자 행동의 시간 패턴(예: 연속적인 구매)이 향후 구매 행동을 예측하는 데 얼마나 기여하는가?
  • RQ5과적합을 피하면서 규칙 기반 통찰을 학습 모델에 효과적으로 통합하는 방법은 무엇인가?

주요 결과

  • 팀은 Tmall 추천 경진대회 2014에서 7,276개 팀 중 7위를 기록하며 F₁ 스코어 0.0611을 달성하였다.
  • 예측 윈도우의 첫 3일 내에서 구매 예측 성능이 뚜렷이 향상되었으며, 시간이 지남에 따라 성능이 떨어졌다.
  • 로지스틱 회귀를 활용한 개별 모델 혼합이 단독 모델 대비 일반화 성능을 향상시키고 과적합을 줄였다.
  • 규칙 기반 인사이트를 이진 플래그 특징으로 통합하는 것이 직접 예측값을 모델 출력에 추가하는 것보다 성능이 뛰어났다.
  • 첫 활동일, 마지막 활동일, 마지막 구매일 및 활동 기간 길이 등의 글로벌 특징은 예측에 강력하고 유용한 신호를 제공하였다.
  • 글로벌 스코링에서의 시간 감쇠 함수는 최근 행동을 효과적으로 우선시하여 모델의 최근성 민감도를 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.