Skip to main content
QUICK REVIEW

[論文レビュー] Extended UCB Policy for Multi-Armed Bandit with Light-Tailed Reward Distributions

Keqin Liu, Qing Zhao|arXiv (Cornell University)|Dec 8, 2011
Advanced Bandit Algorithms Research参考文献 7被引用数 5
ひとこと要約

本稿は、モーメント生成関数の存在を活用することで、局所的サブガウス型とされる軽尾型報酬分布に対して、最適な対数的レジストを達成するようにUCB1インデックス方策を拡張する。提案された拡張UCB方策は、有限なサポートを持つ分布に限らない範囲へ応用を拡大しつつ、対数的レジストのスケーリングを維持する。

ABSTRACT

We consider the multi-armed bandit problems in which a player aims to accrue reward by sequentially playing a given set of arms with unknown reward statistics. In the classic work, policies were proposed to achieve the optimal logarithmic regret order for some special classes of light-tailed reward distributions, e.g., Auer et al.'s UCB1 index policy for reward distributions with finite support. In this paper, we extend Auer et al.'s UCB1 index policy to achieve the optimal logarithmic regret order for all light-tailed (or equivalently, locally sub-Gaussian) reward distributions defined by the (local) existence of the moment-generating function.

研究の動機と目的

  • 有限なサポートを持つ報酬分布に対してのみ最適なレジストを達成できる既存のUCB方策の制限を解消すること。
  • 報酬分布の局所的モーメント生成関数の存在を前提として、UCB1インデックス方策を、すべての軽尾型報酬分布へ一般化すること。
  • より広い分布的仮定のもとでも、最適な対数的レジストの順序を維持すること。
  • 理論的裏付けをもつUCB1の拡張を提供し、より広いクラスの報酬分布に対してレジスト最適性を保つこと。

提案手法

  • 軽尾型分布におけるモーメント生成関数から導かれる高階モーメント情報を取り入れた拡張UCBインデックスを提案する。
  • 局所的サブガウス型性質を用いて尾確率を抑え、各アームの期待報酬に対する信頼区間を導出する。
  • UCB1のサンプリングルールを、有限サポートの仮定の代わりに、モーメント生成関数の局所的存在を条件とする形に適応する。
  • 累積量生成関数から導かれる分散プロキシに比例する新しい上側信頼区間を導出する。
  • 局所的サブガウス型条件を満たす分布に適用可能なレジスト分析フレームワークを確立する。
  • 拡張されたインデックス方策が、UCB1と同様に、時間に比例する対数的レジストの順序を維持することを示す。

実験結果

リサーチクエスチョン

  • RQ1UCB1方策は、有限なサポートを持たない軽尾型報酬分布に対しても最適なレジストを達成できるか?
  • RQ2マルチアームバンディット設定において、対数的レジストを維持するための報酬分布に必要な条件は何か?
  • RQ3報酬分布が局所的サブガウス型ではあるが、必ずしも有界ではない場合、UCBの信頼区間はどのように適応できるか?
  • RQ4局所的サブガウス型分布の広いクラスにおいて、最適なレジスト順序を維持することは可能か?

主な発見

  • 提案された拡張UCB方策は、局所的サブガウス型とされるすべての軽尾型報酬分布に対して、最適な対数的レジストの順序を達成する。
  • レジストバウンドは時間に比例して対数的にスケーリングされ、マルチアームバンディット問題の理論的下界と一致する。
  • 報酬が有界である必要がなくなり、モーメント生成関数が局所的に存在する限り、より重い尾を持つ分布へもUCB1を一般化できる。
  • この方法は、UCB1と同等のレジストレートを維持しており、新たな分布的仮定のもとでも性能が低下しないことを確認する。
  • 分析により、局所的サブガウス型条件が、レジスト制御に不可欠なタイトな信頼区間を導出するのに十分であることが示された。
  • 拡張された方策は、元のUCB1よりもはるかに広い報酬分布のクラスに適用可能であり、正規分布、指数分布、その他の軽尾型分布を含む。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。