Skip to main content
QUICK REVIEW

[논문 리뷰] A Deep Probabilistic Model for Customer Lifetime Value Prediction

Xiaojing Wang, Tianqi Liu|arXiv (Cornell University)|2019. 12. 16.
Customer churn and segmentation참고 문헌 29인용 수 11
한 줄 요약

이 논문은 신규 고객의 고객 생애가치(LTV)를 예측하기 위해 영이 포함된 로그정규분포(ZILN) 손실 함수를 갖는 딥 네ural 네트워크(DNN) 모델을 제안한다. 이는 영이 많은 LTV 분포와 뚜렷한 꼬리가 있는 분포의 과제를 다루며, 이중으로 모델링된 이탈 확률과 LTV 예측 및 불확실성 측정을 동시에 수행한다. 두 개의 실세계 데이터셋에서 평균제곱오차(MSE) 손실보다 분류 및 校정 능력에서 뛰어나다.

ABSTRACT

Accurate predictions of customers' future lifetime value (LTV) given their attributes and past purchase behavior enables a more customer-centric marketing strategy. Marketers can segment customers into various buckets based on the predicted LTV and, in turn, customize marketing messages or advertising copies to serve customers in different segments better. Furthermore, LTV predictions can directly inform marketing budget allocations and improve real-time targeting and bidding of ad impressions. One challenge of LTV modeling is that some customers never come back, and the distribution of LTV can be heavy-tailed. The commonly used mean squared error (MSE) loss does not accommodate the significant fraction of zero value LTV from one-time purchasers and can be sensitive to extremely large LTV's from top spenders. In this article, we model the distribution of LTV given associated features as a mixture of zero point mass and lognormal distribution, which we refer to as the zero-inflated lognormal (ZILN) distribution. This modeling approach allows us to capture the churn probability and account for the heavy-tailedness nature of LTV at the same time. It also yields straightforward uncertainty quantification of the point prediction. The ZILN loss can be used in both linear models and deep neural networks (DNN). For model evaluation, we recommend the normalized Gini coefficient to quantify model discrimination and decile charts to assess model calibration. Empirically, we demonstrate the predictive performance of our proposed model on two real-world public datasets.

연구 동기 및 목표

  • 기존의 BTYD 모델이 적용되지 않는, 역학적 구매 빈도 및 최근 구매 기록이 없는 신규 고객의 LTV 예측을 향상시키기 위해.
  • LTV 회귀에서의 이중 과제인 영이 많은 레이블(일회성 구매자)과 무거운 꼬리 분포(고액 소비자)를 다루기 위해.
  • 동시에 이탈 확률과 LTV 예측 및 불확실성 측정을 수행하는 통합된 딥러닝 프레임워크를 개발하기 위해.
  • MSE보다 정규화된 지니 계수와 디시르 차트를 LTV 모델링의 우월한 평가 지표로 권장하기 위해.
  • 실세계 마케팅 상황에서 ZILN 손실의 효과성을 입증하고, 특히 광고 타겟팅 최적화와 캠페인 수익성 향상에 기여하기 위해.

제안 방법

  • 이탈자에 대한 영점 질량과 재구매자에 대한 로그정규분포의 혼합으로 LTV 분포를 모델링하여 영이 포함된 로그정규분포(ZILN)를 구성한다.
  • 딥 네ural 네트워크에서 가역적인 ZILN 손실 함수를 사용하여 영 LTV 확률과 양의 LTV 기대값을 동시에 최적화한다.
  • 두 단계 모델링 파ipline이 필요 없이 고객 특성과 LTV 간의 복잡한 비선형 관계를 캡처할 수 있는 엔드 투 엔드 학습을 가능하게 한다.
  • 예측 분포를 제공하여 예측 분산을 통한 점 추정치의 불확실성 측정이 가능하다.
  • 스토하스틱 기울기 하강법을 사용하여 ZILN 손실로 훈련하는 네 개의 완전 연결층을 갖는 DNN 아키텍처를 활용한다.
  • 모델 성능 평가에 정규화된 지니 계수를 사용하여 분류 능력을 평가하고, 디시르 수준의 MAPE를 사용하여 校정 능력을 평가하며, 이탈 예측에 대해 정밀도-재현율 AUC를 사용한다.

실험 결과

연구 질문

  • RQ1ZILN 손실 함수를 갖는 딥 네럴 네트워크는 신규 고객의 고객 생애가치(LTV) 예측에서 표준 MSE 기반의 회귀보다 뛰어나지 않는가?
  • RQ2ZILN 모델은 MSE보다 실세계 LTV 분포의 영이 많은 특성과 뚜렷한 꼬리 특성을 더 잘 포착하는가?
  • RQ3ZILN 모델은 LTV 예측 과제에서 모델의 분류 능력과 校정 능력을 어느 정도 향상시키는가?
  • RQ4ZILN 모델은 직접 우표 캠페인 수익성 등 실세계 마케팅 결과를 향상시킬 수 있는가?
  • RQ5ZILN 손실은 단일 딥러닝 프레임워크 내에서 이탈 확률과 LTV 예측을 동시에 모델링하는 데 효과적인가?

주요 결과

  • Kaggle Acquire Valued Shoppers Challenge 데이터셋에서 ZILN 손실은 정규화된 지니 계수 0.911을 기록하여 MSE(0.906)보다 분류 능력에서 뛰어나다.
  • KDD Cup 1998 데이터셋에서 ZILN 손실은 스피어만 순위 상관관계 0.027을 기록하여 MSE(0.020)보다 고액 기부자 순위 매김 능력에서 뛰어나다.
  • ZILN 모델은 KDD Cup 1998에서 정규화된 지니 계수 0.190을 기록하여 MSE(0.184)보다 고가치 고객과 저가치 고객을 더 잘 구분하는 능력을 보였다.
  • ZILN 모델은 디시르 수준의 MAPE를 0.176으로 줄였고, MSE는 0.210이었으며, 이는 더 나은 모델 校정 능력을 의미한다.
  • KDD Cup 1998 캠페인에서 ZILN 기반 DNN은 총 수익 15,498.24달러를 기록하여 경쟁자 우승자인 14,712.24달러 대비 5% 상대적 향상률을 보였다.
  • ZILN 모델은 두 단계 파이프라인의 필요성을 제거하여 단일 엔드 투 엔드 프레임워크 내에서 이탈과 LTV 예측을 동시에 모델링했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.