Skip to main content
QUICK REVIEW

[論文レビュー] An algorithm with nearly optimal pseudo-regret for both stochastic and adversarial bandits

Peter Auer, Chao-Kai Chiang|arXiv (Cornell University)|May 27, 2016
Advanced Bandit Algorithms Research参考文献 5被引用数 22
ひとこと要約

本稿では、確率的および敵対的マルチアームバンディット設定の両方でほぼ最適な擬似再帰的損失を達成するSAPOアルゴリズムを提示する。このアルゴリズムは、適応的探索と信頼区間の追跡を組み合わせ、必要に応じてExp3.Pに切り替えることで、確率的損失は$O(\log n)$、敵対的損失は$O(\sqrt{n \log n})$を達成し、これらの2つの領域間のトレードオフに関する未解決の問題を解決する。

ABSTRACT

We present an algorithm that achieves almost optimal pseudo-regret bounds against adversarial and stochastic bandits. Against adversarial bandits the pseudo-regret is $O(K\sqrt{n \log n})$ and against stochastic bandits the pseudo-regret is $O(\sum_i (\log n)/Δ_i)$. We also show that no algorithm with $O(\log n)$ pseudo-regret against stochastic bandits can achieve $ ilde{O}(\sqrt{n})$ expected regret against adaptive adversarial bandits. This complements previous results of Bubeck and Slivkins (2012) that show $ ilde{O}(\sqrt{n})$ expected adversarial regret with $O((\log n)^2)$ stochastic pseudo-regret.

研究の動機と目的

  • 確率的および敵対的バンディットの既知の境界のギャップを埋めるために、両領域で良好に動作する1つのアルゴリズムを設計すること。
  • $O(\log n)$の確率的擬似再帰的損失が$\tilde{O}(\sqrt{n})$の敵対的損失と両立可能かどうかを特定すること。
  • 確率的および敵対的環境におけるパフォーマンスの根本的トレードオフを特定すること。
  • 確率的および敵対的損失の間の必要なトレードオフに対するタイトな下界を確立すること。

提案手法

  • SAPOアルゴリズムは二段階戦略を用いる:信頼区間を伴う能動的探索の後、必要に応じてExp3.Pに切り替える。
  • 潜在的損失を追跡するために、下位信頼区間$\mathrm{lcb}^*(t)$を維持し、アームの品質を評価するためのテストフェーズを用いる。
  • ギャップに基づくしきい値$C_{\mathrm{gap}} \cdot \tilde{\Delta}_i$を用いて、悪いアームを適切に特定・除外することで、損失を制御する。
  • 二重化と半減化による動的調整により、フェーズ長を制御し、$M = \lceil \log_2 n \rceil + 2E^0$で上限を設ける。
  • ベルヌーイの不等式およびホーフィング=アズマの変種を含む集中不等式を用いて、プレイ回数の期待損失および分散を制限する。
  • 適応的敵対者に対するロバスト性を確保するため、時間$n_S$でExp3.Pへの切り替えをトリガーするメカニズムを導入する。

実験結果

リサーチクエスチョン

  • RQ1$O(\log n)$の確率的擬似再帰的損失を達成しながら、$\tilde{O}(\sqrt{n})$の敵対的擬似再帰的損失を維持できるアルゴリズムは存在するか?
  • RQ2$\tilde{O}(\sqrt{n})$の敵対的損失を達成するには、$O((\log n)^2)$の確率的擬似再帰的損失が必須であるか?
  • RQ3確率的および敵対的バンディット設定の両方で低損失を達成するための根本的限界は何か?
  • RQ41つのアルゴリズムが、両方のバンディットタイプに適応的に探索と報酬のバランスを取れるか?

主な発見

  • SAPOアルゴリズムは、$O(\log n)$の確率的擬似再帰的損失と$O(\sqrt{n \log n})$の敵対的擬似再帰的損失を達成し、それぞれの領域で既知の最良の境界と一致する。
  • 任意の$\beta < 2$に対して、$O((\log n)^\beta)$の確率的擬似再帰的損失は、$\alpha < 1$の下で、無作為な敵対者に対して確率$\Omega(n^{-\epsilon})$で$\Omega(n^\alpha)$の損失を引き起こすことが示唆される。
  • $O(\log n)$の確率的擬似再帰的損失を達成するいかなるアルゴリズムも、適応的敵対者に対して$\tilde{O}(\sqrt{n})$の期待損失を達成することはできない。
  • 解析により、$\tilde{O}(\sqrt{n})$の敵対的損失を達成するには、$O((\log n)^2)$の確率的擬似再帰的損失が必須であることが確認され、タイトなトレードオフが裏付けられた。
  • アルゴリズムは、任意の悪いアームのプレイ回数が、高確率で$O(M / \tilde{\Delta}_i^2)$に抑えられることを保証する。ここで$M = \lceil \log_2 n \rceil + 2E^0$である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。