Skip to main content
QUICK REVIEW

[論文レビュー] On the Optimality of Perturbations in Stochastic and Adversarial Multi-armed Bandit Problems

Baekjin Kim, Ambuj Tewari|arXiv (Cornell University)|Feb 2, 2019
Advanced Bandit Algorithms Research参考文献 24被引用数 3
ひとこと要約

本稿は、サブガウス型報酬を伴う確率的マルチアームバンディットにおける、摂動に基づくアルゴリズムのための最初の統一的レグレット解析を確立し、サブ・ワイブルおよび有界摂動に対してインスタンス最適な境界を証明する。さらに、摂動によるミニマックス最適性の達成における根本的障壁を同定し、最適な摂動はフレシェ型でなければならないと示唆する。特に、Tsallisエントロピー正則化が既知の摂動スキームに匹敵しないアドバーシャル設定においてそうである。

ABSTRACT

We investigate the optimality of perturbation based algorithms in the stochastic and adversarial multi-armed bandit problems. For the stochastic case, we provide a unified regret analysis for both sub-Weibull and bounded perturbations when rewards are sub-Gaussian. Our bounds are instance optimal for sub-Weibull perturbations with parameter 2 that also have a matching lower tail bound, and all bounded support perturbations where there is sufficient probability mass at the extremes of the support. For the adversarial setting, we prove rigorous barriers against two natural solution approaches using tools from discrete choice theory and extreme value theory. Our results suggest that the optimal perturbation, if it exists, will be of Frechet-type.

研究の動機と目的

  • サブガウス型報酬を伴う確率的マルチアームバンディットにおける摂動ベースのアルゴリズムのための統一的レグレット解析を提供すること。
  • 摂動ベースのアルゴリズムが、特にサブ・ワイブルおよび有界サポート摂動に対してインスタンス最適なレグレットを達成する条件を同定すること。
  • 摂動がアドバーシャルバンディットにおいてミニマックス最適性を達成できるかどうかを調査し、Tsallisエントロピー正則化の性能に匹敵することを目的とする。
  • アドバーシャル設定において摂動を用いたミニマックス最適性を達成するための2つの自然なアプローチに対する理論的障壁を確立すること。

提案手法

  • サブガウス型報酬の下で、サブ・ワイブルおよび有界摂動を用いたフォローザ・ペルトゥーブド・リーダー(FTPL)アルゴリズムの一般レグレット境界を導出する。
  • 極値理論と離散的選択理論を用いて、摂動分布の尾部挙動とそのレグレットへの影響を分析する。
  • ガブメルの補題と正則化と摂動の関係を用いて、ガウス的事前分布を用いたサンプリングの再解釈を、摂動アルゴリズムとして行う。
  • Abernethyら[2]のハザードレート条件を用いて、摂動分布を分類し、それらがアドバーシャルバンディットに適しているかどうかを評価する。
  • Tsallisエントロピーが誘導する選択確率関数を分析し、K ≥ 4本のアームにおいて、いかなる摂動でもそれを正確に再現できないことを示す。
  • 漸近的尾部挙動と極値理論に基づき、Tsallisエントロピーに等価な摂動はフレシェ型でなければならないことを示す。

実験結果

リサーチクエスチョン

  • RQ1サブガウス型報酬を伴う確率的マルチアームバンディットにおいて、摂動ベースのアルゴリズムがいつインスタンス最適なレグレットを達成するのか?
  • RQ2摂動は、アドバーシャルバンディットにおいてTsallisエントロピー正則化のミニマックス最適なレグレットを再現できるか?
  • RQ3Tsallisエントロピーのようなエントロピーに基づく正則化子の性能に匹敵するための摂動が、根本的な理論的障壁に阻まれているか?
  • RQ4アドバーシャルバンディットにおける最適な摂動ベースのアルゴリズムに必要な分布(例:フレシェ、ガブメル)のクラスは何か?
  • RQ5Tsallisエントロピー正則化を用いたFTRLの選択確率を正確に模倣する摂動分布が存在するか?

主な発見

  • 本稿は、パラメータ2のサブ・ワイブル摂動に対してインスタンス最適なレグレット境界と一致する下側尾部境界を確立し、極端な場所に十分な質量を持つ有界サポート摂動に対しても同様の結果を得る。
  • 有界サポート摂動の場合、解析には一様分布およびラダマッハ分布が含まれており、信頼区間の境界からランダムに選択するUCBの確率的変種に対する新たなレグレット境界が得られる。
  • ガウス的事前分布と報酬を用いたサンプリングが、ガウス的摂動を用いた摂動ベースのアルゴリズムと等価であることが示され、ガウス的設定を超えた既存の結果を一般化する。
  • 本稿は、K ≥ 4の場合に、Tsallisエントロピー正則化を用いたFTRLの選択確率をいかなる摂動でも正確に再現できないことを証明し、重要な未解決問題を解決する。
  • 既存の摂動に対するより良い解析でも、レグレット境界におけるO(√(log K))要因を排除できないことが示され、現在の摂動族に内在する限界が明らかになる。
  • 極値理論および重尾分布におけるハザードレートの漸近的挙動に基づき、最適な摂動(もしあるならば)はフレシェ型でなければならないと示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。