[論文レビュー] Thompson Sampling for a Fatigue-aware Online Recommendation System
本稿では、組み合わせバンディット設定における疲労感知オンライン推薦の文脈で、Thompson samplingに基づくアルゴリズム、Sequential Bandit Online Recommendation System (SBORS) を提案する。ユーザーの疲労と位置効果をパラメトリックな確率的フィードバックでモデル化することで、アイテム数に関して多項式的レジストを達成する。具体的には、$ C_1N^2\sqrt{NT\log TR} + C_2N\sqrt{T\log TR \cdot \log T} + C_3N/R $ を達成し、最大5倍低いレジストを示すシミュレーションにおいて、UCBベースのベースラインを上回る性能を発揮する。
In this paper we consider an online recommendation setting, where a platform recommends a sequence of items to its users at every time period. The users respond by selecting one of the items recommended or abandon the platform due to fatigue from seeing less useful items. Assuming a parametric stochastic model of user behavior, which captures positional effects of these items as well as the abandoning behavior of users, the platform's goal is to recommend sequences of items that are competitive to the single best sequence of items in hindsight, without knowing the true user model a priori. Naively applying a stochastic bandit algorithm in this setting leads to an exponential dependence on the number of items. We propose a new Thompson sampling based algorithm with expected regret that is polynomial in the number of items in this combinatorial setting, and performs extremely well in practice.
研究の動機と目的
- 繰り返し低価値のアイテムにさらされることでユーザーが離脱するという、オンライン推薦システムにおけるユーザーの疲労の課題に対処すること。
- 長期間にわたる利便性を最大化すると同時に、レジストを最小限に抑えるために、順序付きアイテムシーケンスを選択する組み合わせバンディットアルゴリズムを設計すること。
- アイテムの質、位置効果、離脱ペナルティを組み合わせたパラメトリックな確率的プロセスとしてユーザー行動をモデル化すること。
- アイテム数に多項式的スケーリングする、証明可能なレジストバウンドを持つThompson samplingに基づくアルゴリズムを設計し、ナードMABアプローチで見られる指数的依存を回避すること。
提案手法
- SBORSは、ユーザーの好みと離脱パラメータの不確実性をモデル化するために、ガウス分布を用いた後方分布近似を用いたThompson samplingを採用する。
- アイテム間の相関サンプリングを用いることで、アイテムの利便性と疲労効果の依存関係を活用し、探索の整合性を維持する。
- 調整可能なパラメータ $ R $ を用いた分散ブースティングにより、初期ラウンドでの探索を強化し、収束を改善する。
- ベイズ更新を用いて、アイテムの利便性 $ u_i $、離脱確率 $ p_i $、報酬分布の信念分布を動的に更新する。
- 推薦方針は、期待利便性 $ \mathbb{E}[U(\mathbf{S}; \mathbf{u}_{t-1}^{UCB}, q_{t-1}^{UCB})] $ を最大化するようなシーケンス $ \mathbf{S}^t $ を選択し、探索と活用のバランスを取る。
- SBORS実行前の後方推定を初期化するために、UCBに類似した前駆アルゴリズム(アルゴリズム1)が使用される。
実験結果
リサーチクエスチョン
- RQ1ユーザーの疲労と未知の好みモデルを想定した組み合わせオンライン推薦において、Thompson samplingに基づくアルゴリズムが多項式的レジストを達成できるか。
- RQ2SBORSにおける探索と活用のトレードオフは、UCBベースのアプローチと比較して、レジストと収束速度の観点でどのように異なるか。
- RQ3アルゴリズムの主要パラメータ $ R $、$ \alpha $、$ \beta $ が、実際のレジストと収束に与える影響は何か。
- RQ4提案された後方分布近似と相関サンプリング戦略は、疲労感知設定における標準的なバンディットアルゴリズムと比較して、性能を向上させるか。
主な発見
- SBORSは、アイテム数 $ N $ に対して多項式的スケーリングする、レジスト上界 $ C_1N^2\sqrt{NT\log TR} + C_2N\sqrt{T\log TR \cdot \log T} + C_3N/R $ を達成し、指数的依存を回避する。
- N=30 のシミュレーションにおいて、$ \mathbf{u} \sim [0,0.1] $ の場合のレジスト270.1から、$ \mathbf{u} \sim [0,0.5] $ の場合の91.2に減少し、ユーザーの好みが広がっている場合に収束が速く、レジストが低くなることが示された。
- サンプリングパラメータ $ R $ の値が低いほどレジストが低下し、$ R=1 $ でも良好な性能を示した。これは、分散ブースティングが探索の効率を高めることを示唆している。
- $ \alpha $ と $ \beta $ の値が低いほどレジストが低下し、理論的下限 $ \beta \geq 2 $ よりも $ \beta < 2 $ の場合に実験的に優れた性能を示した。これは、解析に余裕がある可能性を示している。
- アルゴリズム1(SBORSの前駆)は、CaoとSun(2019)のUCBベースのアルゴリズムよりも著しく低いレジストを達成し、複数回の実行で累積レジストが少なくとも5倍低減された。
- SBORSは、$ \mathbf{u} $、$ R $、$ \alpha $、$ \beta $ の変動にかかわらず、多様なパラメータ設定下でベースラインを一貫して上回る性能を示し、安定した性能向上を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。