Skip to main content
QUICK REVIEW

[論文レビュー] A Deep Probabilistic Model for Customer Lifetime Value Prediction

Xiaojing Wang, Tianqi Liu|arXiv (Cornell University)|Dec 16, 2019
Customer churn and segmentation参考文献 29被引用数 11
ひとこと要約

本論文は、新規顧客の顧客生涯価値(LTV)を予測するため、ゼロインflated対数正規(ZILN)損失関数を備えた深層ニューラルネットワーク(DNN)モデルを提案する。この手法は、ゼロインフレートドLTV分布と重い尾を持つ分布という課題に対処し、不確実性の定量化を伴う同時モデル化により、2つの実世界データセットにおいて平均二乗誤差(MSE)損失を上回る区別力と補正性を示した。

ABSTRACT

Accurate predictions of customers' future lifetime value (LTV) given their attributes and past purchase behavior enables a more customer-centric marketing strategy. Marketers can segment customers into various buckets based on the predicted LTV and, in turn, customize marketing messages or advertising copies to serve customers in different segments better. Furthermore, LTV predictions can directly inform marketing budget allocations and improve real-time targeting and bidding of ad impressions. One challenge of LTV modeling is that some customers never come back, and the distribution of LTV can be heavy-tailed. The commonly used mean squared error (MSE) loss does not accommodate the significant fraction of zero value LTV from one-time purchasers and can be sensitive to extremely large LTV's from top spenders. In this article, we model the distribution of LTV given associated features as a mixture of zero point mass and lognormal distribution, which we refer to as the zero-inflated lognormal (ZILN) distribution. This modeling approach allows us to capture the churn probability and account for the heavy-tailedness nature of LTV at the same time. It also yields straightforward uncertainty quantification of the point prediction. The ZILN loss can be used in both linear models and deep neural networks (DNN). For model evaluation, we recommend the normalized Gini coefficient to quantify model discrimination and decile charts to assess model calibration. Empirically, we demonstrate the predictive performance of our proposed model on two real-world public datasets.

研究の動機と目的

  • 従来のBTYDモデルが適用できない、履歴上の購入頻度や最近購入日が欠損している新規顧客のLTV予測を改善すること。
  • LTV回帰における二重の課題、すなわち一回限りの購入者に起因するゼロインフレートラベルと、高額購入者に起因する重い尾を持つ分布に対処すること。
  • 同時に衰退確率とLTV予測、および不確実性の定量化を可能にする統合的深層学習フレームワークの開発。
  • MSEに代えて、LTVモデリングにおいて正規化されたジニ係数とデシリールチャートを、より優れた評価指標として推奨すること。
  • ZILN損失の有効性を、特に広告ターゲティングとキャンペーン利益の最適化といった実世界のマーケティングシナリオで実証すること。

提案手法

  • LTV分布を、衰退者向けのゼロ点質量と、再購入者向けの対数正規分布の混合としてモデル化し、ゼロインフレートド対数正規(ZILN)分布を構築する。
  • DNN内で微分可能なZILN損失関数を用い、ゼロLTVの確率と正のLTVの期待値の両方を同時に最適化する。
  • 2段階のモデリングパイプラインを必要とせず、顧客特徴とLTVの間の複雑で非線形な関係を捉えるエンドツーエンド学習を可能にする。
  • 予測分布の完全な提供により、予測分散を用いた点推定の不確実性の定量化を可能にする。
  • 4層の全結合層を備えたDNNアーキテクチャを採用し、ZILN損失関数を用いた確率的勾配降下法で訓練する。
  • モデルの性能を、区別力の評価に正規化ジニ係数、補正性の評価にデシリールレベルのMAPE、および衰退予測のための精度-再現率AUCを用いて評価する。

実験結果

リサーチクエスチョン

  • RQ1ZILN損失関数を備えた深層ニューラルネットワークは、新規顧客のLTV予測において、標準的なMSEベースの回帰を上回ることができるか?
  • RQ2ZILNモデルは、MSEと比較して、実世界のLTV分布のゼロインフレートドおよび重い尾の性質をよりよく捉えられるか?
  • RQ3ZILNモデルは、LTV予測タスクにおけるモデルの区別力と補正性をどの程度向上させるか?
  • RQ4ZILNモデルは、直接メールキャンペーンの利益といった実世界のマーケティング成果を向上させられるか?
  • RQ5ZILN損失は、1つの深層学習フレームワーク内で、同時に衰退確率とLTV予測をモデル化するのに有効か?

主な発見

  • Kaggle Acquire Valued Shoppers Challengeデータセットでは、ZILN損失が正規化ジニ係数0.911を達成し、MSE(0.906)を上回る区別力を示した。
  • KDD Cup 1998データセットでは、ZILN損失がスピアマンの順位相関係数0.027を達成したのに対し、MSEは0.020であった。これは、高額寄付者をより良い順位にランク付けできたことを示している。
  • ZILNモデルはKDD Cup 1998で正規化ジニ係数0.190を達成したのに対し、MSEは0.184であった。これは、高価値顧客と低価値顧客をより優れた能力で区別できたことを示している。
  • ZILNモデルはデシリールレベルのMAPEを0.176にまで低下させたのに対し、MSEは0.210であった。これは、モデルの補正性が優れていることを示している。
  • KDD Cup 1998キャンペーンにおいて、ZILNベースのDNNは合計15,498.24ドルの利益を上げ、コンペティションの優勝者(14,712.24ドル)と比較して5%の相対的改善を達成した。
  • ZILNモデルは、2段階パイプラインを不要にした。1つのエンドツーエンドフレームワーク内で、同時に衰退とLTV予測をモデル化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。