Skip to main content
QUICK REVIEW

[論文レビュー] Two-stage Cascaded Classifier for Purchase Prediction

Sheikh Muhammad Sarwar, Mahamudul Hasan|arXiv (Cornell University)|Aug 16, 2015
Customer churn and segmentation被引用数 5
ひとこと要約

本論文では、eコマースの購入予測のための2段階級連鎖型分類器を提案する。Adaboost.M1を用いて購入セッション検出におけるクラス不均衡を是正し、ランダムフォレストを用いてアイテム予測を行う。特徴量選択の最適化とソリューションファイルサイズ制約の処理により、45,027のチャレンジスコアを達成した。

ABSTRACT

In this paper we describe our machine learning solution for the RecSys Challenge, 2015. We have proposed a time efficient two-stage cascaded classifier for the prediction of buy sessions and purchased items within such sessions. Based on the model, several interesting features found, and formation of our own test bed, we have achieved a reasonable score. Usage of Random Forests helps us to cope with the effect of the multiplicity of good models depending on varying subsets of features in the purchased items prediction and, in its turn, boosting is used as a suitable technique to overcome severe class imbalance of the buy-session prediction.

研究の動機と目的

  • eコマースのクリックストリームデータにおける深刻なクラス不均衡に対処する。ここでは、5%のセッションしか購入に至らない。
  • 購入セッションと特定の購入アイテムの両方を予測するスケーラブルで効率的な2段階モデルを開発する。
  • モデルのパフォーマンスと25MBのソリューションファイルサイズ制約の両立を図るために、特徴量選択を最適化する。
  • アンサンブル学習手法を用いて、セッションレベルおよびアイテムレベルの分類における予測精度を向上させる。
  • 実際のチャレンジ性能を近似し、モデルチューニングを支援する信頼性の高いテストベッドを構築する。

提案手法

  • WekaフレームワークのAdaboost.M1を用いて、セッションを購入・非購入に分類する。クラス不均衡に強く、安定性を発揮する。
  • 級連アーキテクチャを採用:まずAdaboost.M1で潜在的な購入セッションを特定し、その後ランダムフォレストで特定のアイテムを予測する。
  • クリック数、アイテム頻度、継続時間、時間帯、平均クリック-購入比を含む15のセッションレベル特徴量を抽出する。
  • クラス不均衡の是正のため、リサンプリング手法を適用する。
  • 特徴量サブセットを最適化してモデルサイズを縮小し、25MBの制限内でのソリューションファイル準拠を向上させる。
  • チャレンジ条件を模擬するための自作テストベッドを用いて結果を検証し、ハイパーパramータチューニングを支援する。

実験結果

リサーチクエスチョン

  • RQ12段階級連鎖型分類器は、eコマースのクリックストリームデータにおける極端なクラス不均衡を効果的に処理できるか?
  • RQ2ストレージ制約下で、どのセッションレベル特徴量の組み合わせが最高の予測性能を達成するか?
  • RQ3他の教師あり学習モデルと比較して、Adaboost.M1を用いることで、購入セッション検出の精度はどの程度向上するか?
  • RQ4自作テストベッドは、実際のチャレンジ性能を予測するのに十分な精度を持つか?
  • RQ5特徴量選択は、RecSys Challenge 2015におけるモデルの精度とソリューションファイルサイズのトレードオフにどのように影響するか?

主な発見

  • 2段階級連鎖型分類器は、最終的に45,027のチャレンジスコアを達成し、テストセットにおける最大スコアの37%を占めた。
  • 選択された特徴量を用いたAdaboost.M1は、テストベッドスコア106,508.4を達成し、実際のチャレンジ性能をよく再現した。
  • 時刻関連および集計特徴量を除外することで、精度が向上し、ソリューションサイズが縮小されたが、再現率はわずかに低下した。
  • すべての特徴量を含むモデルは、より高いスコア(107,764)を達成したが、25MBのソリューションファイルサイズ制限を超え、提出不可能であった。
  • ランダムフォレストは、アイテム予測における優れた特徴量サブセットの多様性を効果的に処理でき、さまざまな特徴量の組み合わせに対しても頑健性を示した。
  • 自作テストベッドは、実際のチャレンジ結果と強い相関を示し、信頼性の高いモデルチューニングと評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。