QUICK REVIEW
[論文レビュー] Randomized Allocation with Nonparametric Estimation for Contextual Multi-Armed Bandits with Delayed Rewards
Sakshi Arya, Yuhong Yang|arXiv (Cornell University)|Feb 3, 2019
Advanced Bandit Algorithms Research参考文献 27被引用数 5
ひとこと要約
本稿では、報酬の遅延を伴う文脈的多腕バンディット問題に対して、ヒストグラムに基づく推定を用いて報酬関数を段階的に学習する非パrametricで確率的な割り当て戦略を提案する。この手法は強い一貫性を保証し、フィードバックの確率的遅延が存在する中でも、累積報酬が確実に最適水準に収束することを示している。
ABSTRACT
We study a multi-armed bandit problem with covariates in a setting where there is a possible delay in observing the rewards. Under some mild assumptions on the probability distributions for the delays and using an appropriate randomization to select the arms, the proposed strategy is shown to be strongly consistent.
研究の動機と目的
- 非パrametric設定における文脈的多腕バンディット問題に、遅延報酬が存在する場合の理論的枠組みの欠如に対処する。
- 現実の臨床的およびオンラインアプリケーションにおける遅延を反映させるために、独立で同一分布でない確率的変数として報酬の遅延をモデル化する。
- 遅延フィードバックを考慮しつつ、探索と活用のバランスを取る確率的方策を開発する。
- 報酬関数に最小限の滑らかさの仮定しか設けない条件下でも、アルゴリズムの理論的一貫性を確立する。
- フィードバックが遅れており不完全であっても、推定された報酬が真の期待報酬に収束することを保証する。
提案手法
- 各腕 $ i $ の条件付き平均報酬 $ f_i(x) $ を、共変量の局所的近傍内での観測報酬に基づき、非パラメトリックなヒストグラム推定器を用いて近似する。
- アニールド $ \epsilon $-greedy 戦略を確率的乱数を用いて適用し、探索と活用のバランスを保ち、すべての腕が十分にサンプリングされるようにする。
- 腕 $ i $ が $ x $ の局所的近傍内で選択された回数を $ \bar{N}(x) $ と定義し、これを用いて経験的平均報酬推定器を計算する。
- 推定誤差をモジュラス連続性 $ w(h;f) $ を用いてバインドし、確率的誤差を集中不等式によって制御する。
- 従属するベルヌーイ試行(腕の選択)およびサブ・ワイブル型誤差の和に対して、洗練されたベルンシュタイン不等式を用いて尾確率を制御する。
- 条件付き独立性仮定を活用:腕の選択 $ W_j $ は将来の誤差 $ \epsilon_j $ と独立であり、これにより誤差の重み付き和に対する集中不等式が得られる。
実験結果
リサーチクエスチョン
- RQ1非パラメトリックな文脈的バンディットアルゴリズムは、報酬の遅延フィードバック下でも強い一貫性を維持できるか?
- RQ2報酬が即座に観測されない場合、確率的割り当て戦略の選択が収束に与える影響は何か?
- RQ3非 i.i.d. で、かつ重尾を示す可能性のある遅延が、報酬関数の推定に与える影響は何か?
- RQ4ヒストグラムに基づく非パラメトリック推定は、遅延および不完全なフィードバックが存在する中でも一貫した報酬予測を達成できるか?
- RQ5提案されたアルゴリズムの累積報酬が確実に最適累積報酬に収束する条件は何か?
主な発見
- 提案されたアルゴリズムは強い一貫性を達成する:$ n \to \infty $ のとき、推定報酬関数 $ \hat{f}_n(x) $ は確実に真の $ f(x) $ に収束する。これは遅延フィードバックが存在する場合でも成立する。
- 推定誤差はモジュラス連続性 $ w(h;f) $ と、集中不等式によって制御される確率的項によってバインドされる。
- 大きな推定誤差の確率は、各局所的近傍内の観測数に従い指数関数的に減少し、$ \exp(-c \cdot \min_b N_b) $ という形のバインドによって示されている。
- 解析により、近傍内での腕の選択確率の割合が、その目標割り当て確率 $ \pi_n $ に収束することが保証され、十分な探索が確保される。
- この手法は、既存の遅延バンディットフレームワークと同等の加法的レグルト増加を維持するが、本稿ではレグルトバウンドではなく一貫性に焦点を当てる。
- 洗練されたベルンシュタイン不等式の使用により、$ W_j $ が過去の観測に依存する場合でも、重み付き誤差の和 $ \sum W_j \epsilon_j $ を制御できる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。