[論文レビュー] Heteroscedastic Bandits with Reneging.
本稿では、報酬が個々の受容閾値未満になるとユーザーが永続的に離脱する可能性があり、報酬の分散が文脈に依存する、新しい非定分散文脈的バンディットモデルを提案する。ユーザーの離脱を考慮したHR-UCBアルゴリズムを導入し、高確率でのリグレットが$ mathcal{O}\Big(\sqrt{{T}}\big(\log({T})\big)^{3/2}\Big)$であることを証明した。これは、実世界のユーザーの離脱と非定分散報酬という制限を考慮したものである。
Although shown to be useful in many areas as models for solving sequential decision problems with side observations (contexts), contextual bandits are subject to two major limitations. First, they neglect user that occurs in real-world applications. That is, users unsatisfied with an interaction quit future interactions forever. Second, they assume that the reward distribution is homoscedastic, which is often invalidated by real-world datasets, e.g., datasets from finance. We propose a novel model of heteroscedastic contextual bandits with reneging to overcome the two limitations. Our model allows each user to have a distinct acceptance level, with any interaction falling short of that level resulting in that user reneging. It also allows the variance to be a function of context. We develop a UCB-type of policy, called HR-UCB, and prove that with high probability it achieves $\mathcal{O}\Big(\sqrt{{T}}\big(\log({T})\big)^{3/2}\Big)$ regret.
研究の動機と目的
- 文脈的バンディットがユーザーの離脱(不満による永続的離脱)をモデル化できないという制限に対処すること。
- 報酬の分散が一定であるという仮定を克服し、分散が文脈に依存することを許容すること。
- ユーザー固有の受容レベルと文脈依存の分散の両方を処理できるUCB型アルゴリズムを開発すること。
- これらの現実的な条件下での提案方策のリグレットを理論的に境界づけること。
提案手法
- ユーザーに個別の受容レベルを設定し、そのレベル未満の報酬が与えられると永続的に離脱することをモデル化する。
- 報酬の分散を文脈に依存する関数として許容し、実世界のデータにおける非定分散性を捉える。
- 非定分散性と離脱構造に特化した上位信頼区間を用いてHR-UCBアルゴリズムを設計する。
- 変動する報酬分散を考慮した文脈に適応した信頼区間を統合する。
- 離脱と非定分散性の両方が存在する状況における不確実性を制御するため、高確率の集中不等式を用いる。
- モデルの制約下での非最適行動の累積的影響を分析することで、リグレット境界を証明する。
実験結果
リサーチクエスチョン
- RQ1不満によるユーザーの離脱が生じる状況を考慮する場合、文脈的バンディットモデルはどのように拡張可能か?
- RQ2文脈に依存する報酬分散は、逐次的意思決定におけるリグレットにどのような影響を与えるか?
- RQ3非定分散報酬とユーザーの離脱の両方の条件下で、低リグレットを維持できるUCBベースの方策は設計可能か?
- RQ4これらの制約が重なった状況で達成可能な理論的リグレット境界は何か?
- RQ5個々のユーザーの受容閾値は、長期的な学習パフォーマンスにどのように影響を与えるか?
主な発見
- HR-UCBアルゴリズムは、高確率でのリグレット境界$ mathcal{O}\Big(\sqrt{{T}}\big(\log({T})\big)^{3/2}\Big)$を達成しており、これは非線形的でほぼ最適である。
- モデルは実世界の現象であるユーザーの離脱と非定分散報酬分散を効果的に捉えている。
- リグレット境界は、文脈依存の分散とユーザー固有の受容閾値の両方を考慮している。
- 理論的分析により、不良な相互作用後にユーザーが離脱しても、アルゴリズムが性能を維持していることが確認された。
- 実際の行動的・統計的制約を組み込むことで、標準的な文脈的バンディットに比べて本手法が向上している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。