Skip to main content
QUICK REVIEW

[論文レビュー] Corralling Stochastic Bandit Algorithms

Raman Arora, Teodor V. Marinov|arXiv (Cornell University)|Jun 16, 2020
Advanced Bandit Algorithms Research参考文献 32被引用数 4
ひとこと要約

本稿では、内部構造やアーム集合への直接アクセスが不可能な複数の基本的バンディットアルゴリズムを組み合わせる2つの新しいコーラリングアルゴリズムを提案する。適応的ステップサイズと対数バリア関数を用いたミラー降下を活用することで、$ ilde{O}(b{E}[R_{i^*}(T)] + Kackslash sqrt{T})$ のレグレットバウンドを達成し、$b{E}[R_{i^*}(T)]$ は最良の基本的アルゴリズムのレグレット、$K$ は基本的アルゴリズムの数を表す。これは、確率的設定において、先行研究の$ ilde{O}(ackslash sqrt{T})$ バウンドよりも顕著に改善されたものである。

ABSTRACT

We study the problem of corralling stochastic bandit algorithms, that is combining multiple bandit algorithms designed for a stochastic environment, with the goal of devising a corralling algorithm that performs almost as well as the best base algorithm. We give two general algorithms for this setting, which we show benefit from favorable regret guarantees. We show that the regret of the corralling algorithms is no worse than that of the best algorithm containing the arm with the highest reward, and depends on the gap between the highest reward and other rewards.

研究の動機と目的

  • 内部構造やアーム集合へのアクセスが不可能な複数の確率的バンディットアルゴリズムを組み合わせるコーラリングアルゴリズムの設計。
  • 特に、最良のアームの報酬と他のアームとの間に正のギャップが存在する状況において、最良の基本的アルゴリズムとほぼ同等のレグレット保証を達成すること。
  • ギャップ依存的依存性を活用することで、確率的設定における先行研究の$\tilde{O}(\sqrt{T})$ レグレットバウンドを改善すること。
  • 基本的アルゴリズムが特許を取得済みで直接変更できない実用的状況(例:オンライン広告配信、モーゲージブローカー制度)に対応すること。

提案手法

  • 性能に応じて基本的バンディットアルゴリズムを動的に選択するため、対数バリア関数を用いたミラー降下フレームワークを採用する。
  • 探索と活用のバランスを取るために、非減少の適応的ステップサイズスケジュールを採用する。
  • 自己バウンド・アーギュメントを用いて、アルゴリズムの性能と最良の基本的アルゴリズムとの乖離をバウンドする安定性解析を導入する。
  • 再起動を回避するためのスムージング技術を適用し、耐障害性と収束性を向上させる。
  • 勾配推定と重みの時間的更新のため、デュアル・アベーリージングアプローチを用いる。
  • 全レグレットを最良の基本的アルゴリズムの性能、安定性、ステップサイズ制御に関する項に分解することで、レグレットバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1確率的環境下で、コーラリングアルゴリズムは最良の基本的バンディットアルゴリズムとほぼ同等の低いレグレットを達成できるか?
  • RQ2基本的アルゴリズムの内部パrameterに直接アクセスできない状況でも、ギャップ依存的レグレット保証を達成するにはどうすればよいか?
  • RQ3複数の基本的バンディットアルゴリズムを最適に組み合わせることで、累積レグレットを最小化すると同時に再起動を回避できるか?
  • RQ4基本的アルゴリズムがアームを共有したり、重複する行動集合を持つ場合でも、アルゴリズムは有利なレグレットバウンドを維持できるか?

主な発見

  • コーラリングアルゴリズムは、$\tilde{O}(\bb{E}[R_{i^*}(T)] + K\backslash sqrt{T})$ のレグレットバウンドを達成する。ここで、$\bb{E}[R_{i^*}(T)]$ は最良の基本的アルゴリズムの期待レグレット、$K$ は基本的アルゴリズムの数を表す。
  • 最良のアームの報酬と他のアームとのギャップに有利に依存するため、確率的設定において先行研究の$ ilde{O}(ackslash sqrt{T})$ バウンドを上回る。
  • 再起動を回避するスムージング技術を用いることで、安定的かつ継続的な性能を実現する。
  • ギャップ条件を満たす場合に、自己バウンド・アーギュメントにより、レグレット解析における安定性項をバウンドする。
  • ステップサイズスケジュールを慎重に制御し、重みの安定性を維持する対数バリアミラー写像を用いることで、収束性を向上させる。
  • 理論的解析により、基本的アルゴリズムが未知で相互に通信しない状況下でも、最良の基本的アルゴリズムとほぼ同等に性能を発揮することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。