[論文レビュー] Non-Stationary Bandits with Habituation and Recovery Dynamics
本稿では、逐次的意思決定における習慣化および回復ダイナミクスをモデル化する、非定常的マルチバンディットフレームワークであるROGUEバンディットを提案する。最大尤度推定と有限標本における集中不等式を活用することで、著者らはROGUE-UCBおよびε-ROGUEアルゴリズムを開発し、対数的レグレットを達成した。これは、個人向け健康介入分野において、最先端の手法を著しく上回り、シミュレーションで1日あたり約1,000ステップの歩数増加を実現した。
Many settings involve sequential decision-making where a set of actions can be chosen at each time step, each action provides a stochastic reward, and the distribution for the reward of each action is initially unknown. However, frequent selection of a specific action may reduce its expected reward, while abstaining from choosing an action may cause its expected reward to increase. Such non-stationary phenomena are observed in many real world settings such as personalized healthcare-adherence improving interventions and targeted online advertising. Though finding an optimal policy for general models with non-stationarity is PSPACE-complete, we propose and analyze a new class of models called ROGUE (Reducing or Gaining Unknown Efficacy) bandits, which we show in this paper can capture these phenomena and are amenable to the design of effective policies. We first present a consistent maximum likelihood estimator for the parameters of these models. Next, we construct finite sample concentration bounds that lead to an upper confidence bound policy called the ROGUE Upper Confidence Bound (ROGUE-UCB) algorithm. We prove that under proper conditions the ROGUE-UCB algorithm achieves logarithmic in time regret, unlike existing algorithms which result in linear regret. We conclude with a numerical experiment using real data from a personalized healthcare-adherence improving intervention to increase physical activity. In this intervention, the goal is to optimize the selection of messages (e.g., confidence increasing vs. knowledge increasing) to send to each individual each day to increase adherence and physical activity. Our results show that ROGUE-UCB performs better in terms of regret and average reward as compared to state of the art algorithms, and the use of ROGUE-UCB increases daily step counts by roughly 1,000 steps a day (about a half-mile more of walking) as compared to other algorithms.
研究の動機と目的
- 繰り返しの行動適用が習慣化を引き起こし、行動中止により回復が生じる行動的状況において、定常的バンディットモデルの限界を是正すること。
- 行動頻度が長期的有効性に影響を与える、個人向け健康介入における非定常的報酬ダイナミクスをモデル化すること。
- 報酬ダイナミクスの事前知識が不要な、柔軟かつ解析可能なバンディットフレームワークを構築し、習慣化および回復を捉えること。
- 標準的手法が失敗する非定常環境において、理論的レグレット保証を持つアルゴリズムを設計すること。
- 実世界の身体活動介入データを用いて、提案アルゴリズムの経験的優位性を実証すること。
提案手法
- 行動報酬における習慣化および回復をモデル化する、非定常バンディットの新クラス、ROGUE(Reducing or Gaining Unknown Efficacy)バンディットを提唱する。
- 観測された報酬と行動履歴からモデルパラメータを学習する一貫性のある最大尤度推定(MLE)手法を開発する。
- MLE推定値の有限標本における集中不等式を導出し、アルゴリズム性能の厳密な理論的分析を可能にする。
- 推定された不確実性を用いて、探索と活用のバランスを取る上界信頼区間アルゴリズムであるROGUE-UCBを設計する。
- 徐々に減少する探索率を用いて、活用と探索のバランスを取るε-グリーディアルゴリズムであるε-ROGUEを設計する。
- 報酬尤度にラプラスノイズモデルを用いることで、オフラインパラメータ推定のための混合整数プログラミングへの再定式化を可能にする。
実験結果
リサーチクエスチョン
- RQ1非定常バンディットモデルは、行動介入における習慣化および回復ダイナミクスを効果的に捉えることができるか?
- RQ2非定常性にもかかわらず、対数的レグレットを達成する理論的に有効なアルゴリズムをROGUEバンディットに設計できるか?
- RQ3MLEに基づくパラメータ推定と有限標本における集中不等式は、この設定における信頼性の高いポリシー学習を可能にするか?
- RQ4ROGUE-UCBおよびε-ROGUEは、レグレットおよび平均報酬の観点で、既存の最先端バンディットアルゴリズムを上回るか?
- RQ5提案フレームワークは、実世界の個人向け健康介入において顕著な成果向上を実現できるか?
主な発見
- ROGUE-UCBおよびε-ROGUEは、非定常環境において線形レグレットを被る既存のアルゴリズムとは異なり、期待値において対数的レグレットを達成した。
- 個人向け身体活動介入の実世界データを用いたシミュレーションにおいて、ROGUE-UCBは、次に優れたアルゴリズムと比較して、1日あたり約1,000ステップの歩数増加を達成した。
- 初期段階における探索の削減により、ROGUE-UCBは累積レグレットにおいてε-ROGUEを上回り、初期報酬も高かった。
- ROGUE-UCBおよびε-ROGUEの両方とも、純粋な探索とD-UCBに比べ、平均報酬および累積レグレットの両面で顕著に優れていた。
- MLE推定値の有限標本における集中不等式が成功裏に導出され、提案アルゴリズムの理論的性能保証の根拠として有効に使用された。
- 報酬モデルにおけるラプラスノイズの使用により、混合整数プログラミングソルバーによる効果的なオフラインパラメータ推定が可能になり、実用的導入を促進した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。