Skip to main content
QUICK REVIEW

[論文レビュー] Hierarchical Contextual Uplift Bandits for Catalog Personalization

A. Agrawal, Rajesh Kumar Mohanty|arXiv (Cornell University)|Jan 20, 2026
Advanced Bandit Algorithms Research被引用数 0
ひとこと要約

この論文は、粗-細の文脈階層とアップリフト報酬を利用してDream11のカタログを個別化するHierarchical Contextual Uplift Bandit (HCUB) フレームワークを提案し、オンラインA/Bテストでの収益アップを達成し、ダイナミックな環境での適応を改善します。

ABSTRACT

Contextual Bandit (CB) algorithms are widely adopted for personalized recommendations but often struggle in dynamic environments typical of fantasy sports, where rapid changes in user behavior and dramatic shifts in reward distributions due to external influences necessitate frequent retraining. To address these challenges, we propose a Hierarchical Contextual Uplift Bandit framework. Our framework dynamically adjusts contextual granularity from broad, system-wide insights to detailed, user-specific contexts, using contextual similarity to facilitate effective policy transfer and mitigate cold-start issues. Additionally, we integrate uplift modeling principles into our approach. Results from large-scale A/B testing on the Dream11 fantasy sports platform show that our method significantly enhances recommendation quality, achieving a 0.4% revenue improvement while also improving user satisfaction metrics compared to the current production system. We subsequently deployed this system to production as the default catalog personalization system in May 2025 and observed a further 0.5% revenue improvement.

研究の動機と目的

  • 動的ファンタジースポーツカタログにおける文脈バンディットの環境変化の急速さとコールドスタート問題に対処する。
  • システムレベルからユーザーレベルの文脈を階層的に表現し、ポリシーの移転を可能にする。
  • 報酬としてアップリフトモデリングを組み込み、追加的な事業影響(収益、エンゲージメント、リテンション)を最適化する。
  • オンラインおよびオフラインの性能を評価し、 production deploymentを含む影響を収益とエンゲージメントで定量化する。

提案手法

  • システムレベルからユーザーレベルの特徴までを跨ぐ階層的文脈ツリーを提案する。
  • 短期的なエンゲージメント、リテンション代理、収益のアップリフトの加重和として報酬関数を定義する。
  • 報酬の継承を用い:階層を通じてアップリフト信号を上から下へ伝搬させ、コールドスタートを緩和し探索を安定化する。
  • 階層的ブートストラッピングによりアップリフトを推定し、ノード-アクション対ごとに中央値と信頼区間を得る。
  • 葉ノードでベイズUCBを用いてカタログアクションを選択し、探索と活用をバランスさせる。
  • オンラインA/Bテストとオフラインシミュレーションで評価し、報酬継承を除いた場合のアブレーションも含める。

実験結果

リサーチクエスチョン

  • RQ1HCUBは階層的文脈とアップリフト報酬で、現行のカタログ個人化システムより収益とエンゲージメントを向上させるか。
  • RQ2階層的報酬の継承が、非定常でダイナミックな環境における学習速度と適応に与える影響は何か。
  • RQ3大規模なオンライン展開とオフラインシミュレーションにおけるHCUBのパフォーマンスは、後悔(レグレット)とビジネスメトリクスの観点でどう違うか。
  • RQ4報酬継承はユーザーコホートとシステムレベル文脈全体の学習を安定させ、コールドスタートを緩和できるか。

主な発見

  • オンライン実験でHCUBによる収益アップを示す:2025年2–3月(600万人)+0.42%、2025年5月〜現在(Dream11全体基盤)+0.51%。
  • DAUの変化は小さく統計的有意ではない:2–3月で+0.05%、5月〜現在で+0.1%。
  • オフラインシミュレーションでは、報酬継承を用いる場合に比べ継承なしの場合より4–5%のレグレット改善を示唆。
  • 本番展開は収益改善を達成し、HCUBの本番適用可能性を検証。
  • このアプローチは、短期・長期のエンゲージメント指標を維持または改善しつつ、顕著な収益向上を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。