Skip to main content
QUICK REVIEW

[論文レビュー] Finite-time Regret Bound of a Bandit Algorithm for the Semi-bounded Support Model

Junya Honda, Akimichi Takemura|arXiv (Cornell University)|Feb 10, 2012
Advanced Bandit Algorithms Research参考文献 9被引用数 3
ひとこと要約

本稿は、報酬が$(-\infty,1]$に含まれる半有界サポートモデルにおいて、DMEDバンディットアルゴリズムの初めての有限時間レジームバウンドを確立する。報酬はモーメント生成関数を持つ。大偏差確率の精緻化と下位サポートバウンドの必要性の緩和により、著者らはDMEDが非漸近的レジームバウンドを達成し、最適な漸近的性能を示すことを証明した。これは、$[0,1]$に有界な報酬に限らない、応用範囲の拡張を可能にする。

ABSTRACT

In this paper we consider stochastic multiarmed bandit problems. Recently a policy, DMED, is proposed and proved to achieve the asymptotic bound for the model that each reward distribution is supported in a known bounded interval, e.g. [0,1]. However, the derived regret bound is described in an asymptotic form and the performance in finite time has been unknown. We inspect this policy and derive a finite-time regret bound by refining large deviation probabilities to a simple finite form. Further, this observation reveals that the assumption on the lower-boundedness of the support is not essential and can be replaced with a weaker one, the existence of the moment generating function.

研究の動機と目的

  • ステochasticマルチアームバンディット問題におけるDMEDバンディットアルゴリズムの漸近的最適性と有限時間性能のギャップを埋めること。
  • 既知の下位サポートバウンド(例:$[0,1]$における0)の仮定を緩和し、最適なレジームに必要なものでないことを示すこと。
  • 報酬分布がゼロの近傍でモーメント生成関数を有するというより弱い条件下で、DMEDの非漸近的レジームバウンドを導出すること。
  • モデルを$\mathcal{A}_0$(有界$[0,1]$)から$\mathcal{A}$(半有界$(-\infty,1]$)に拡張しても、理論的レジーム下限が変わらないことを示すこと。

提案手法

  • 著者らは、経験的発散$D_{\mathrm{inf}}(\hat{F}_i, \mu)$のための大偏差確率を精緻化し、経験的分布のカウントやカバーイングに依存せずに有限時間バウンドを導出する。
  • Cramérの定理を用いて、Kullback-Leibler発散と累積生成関数の双対性を活用し、経験的平均および発散の尾確率をバウンドする。
  • 重要な技術的ステップとして、累積生成関数のLegendre変換を用いて、経験的発散が真の値から逸脱する確率をバウンドする。
  • レジームを、平均の過大評価と過小評価に関連する事象に分解することで、非最適アームの引き当て回数の期待値に対する非漸近的バウンドを活用する。
  • 期待値の引き当て回数を制御するため、新規のカップリング論法とモーメント生成関数に基づく集中不等式を用いる。
  • 尾確率から生じる指数的項の幾何級数バウンドを適用し、時間ステップの和を取ることで、レジームバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1報酬が$(-\infty,1]$に含まれる半有界サポートモデルにおいて、DMEDアルゴリズムに有限時間レジームバウンドを確立できるか?
  • RQ2$[0,1]$における例のように、下位サポートバウンド(例:0)の仮定は、DMEDフレームワークにおける漸近的レジームバウンドを達成するために必須か?
  • RQ3報酬分布がゼロの近傍でのみモーメント生成関数を有する場合、DMEDのレジームバウンドを有界サポートではなく拡張可能か?
  • RQ4モデルを$\mathcal{A}_0$から$\mathcal{A}$に拡張しても、理論的レジーム下限は変わらないか?ただし$\mathcal{A}_0 \subset \mathcal{A}$である。

主な発見

  • 本稿は、報酬が$(-\infty,1]$に含まれる半有界サポートモデル$\mathcal{A}$において、DMEDアルゴリズムの有限時間レジームバウンドを確立した。報酬はゼロの近傍でモーメント生成関数を持つ。
  • レジームバウンドは$\sum_{i:\mu_i < \mu^*} \frac{\log n}{D_{\mathrm{inf}}(F_i, \mu^*; \mathcal{A})} + O(1)$の形を取り、定数因子を除いて漸近的下限と一致する。
  • 著者らは、すべての$F_i \in \mathcal{A}_0$に対して$D_{\mathrm{inf}}(F_i, \mu^*; \mathcal{A}_0) = D_{\mathrm{inf}}(F_i, \mu^*; \mathcal{A})$を証明し、拡張モデル下でも理論的下限が変わらないことを示した。
  • 下位サポートバウンドの仮定は、DMEDの漸近的最適性にとって本質的ではない。代わりに、モーメント生成関数の存在で十分である。
  • 従来の非漸近的Sanovベースの解析で生じる取り扱いが困難な項を避けるために、経験的分布のカウントやカバーイングに依存しない。
  • 解析により、非最適アームの引き当て回数の期待値が指数的項の和でバウンドされ、$n$に関して多対数的レジームバウンドが得られることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。