Skip to main content
QUICK REVIEW

[論文レビュー] Better Algorithms for Stochastic Bandits with Adversarial Corruptions

Anupam Gupta, Tomer Koren|arXiv (Cornell University)|Feb 22, 2019
Advanced Bandit Algorithms Research参考文献 26被引用数 13
ひとこと要約

この論文は、敵対的汚染下での確率的マルチアームバンディットに対して、腐敗レベル $C$ に加法的に依存するレグレットを達成する、BARBAR と呼ばれる新しいアルゴリズムを導入する。これは乗法的依存とは異なり、腐敗が大きくてもロバストな性能を実現できる。アルゴリズムは $C$ に対してアーギノスティックであり、自動的に適応し、最適な腐敗なしレグレットに加法的に $O(KC)$ の項を加えた形で一致する。

ABSTRACT

We study the stochastic multi-armed bandits problem in the presence of adversarial corruption. We present a new algorithm for this problem whose regret is nearly optimal, substantially improving upon previous work. Our algorithm is agnostic to the level of adversarial contamination and can tolerate a significant amount of corruption with virtually no degradation in performance.

研究の動機と目的

  • 報酬が敵対的汚染を受ける状況下でも、強いレグレット保証を維持する課題に対処すること。
  • 腐敗総量 $C$ に比例する乗法的劣化を示す従来のアルゴリズムの限界を克服すること。
  • $C$ の事前知識が不要な、腐敗レベル $C$ に対してアーギノスティックである手法を設計すること。
  • 腐敗のない最適な確率的状況から敵対的状態への滑らかなレグレット劣化を達成すること。
  • 低腐敗および高腐敗レベルの両方においても高い性能を維持する、シンプルで実用的なアルゴリズムを提供すること。

提案手法

  • 複数のUCB風探索フェーズと適応的フィルタリングを組み合わせた、BARBAR と呼ばれる新しいアルゴリズムを提案。腐敗されたフィードバックを検出し緩和する。
  • 各レイヤーが徐々に拡大する信頼区間を用いる層状構造を採用。冗長性によりレジリエンスを実現。
  • 各レイヤー間での報酬の一貫性チェックに基づく、腐敗検出のための新規メカニズムを導入。腐敗フィードバックを特定・破棄可能。
  • アーム平均値と信頼区間を別々に保持し、一貫性のあるフィードバックでのみ更新することで、腐敗によるバイアスを回避。
  • 観測された報酬の一貫性に基づいて、最も信頼性の高いレイヤーを動的に選択。これにより、最終選択が敵対的汚染に対してレジリエントになる。
  • 腐敗が最大 $C$ ラウンドまで存在しても、多数の一貫性のある観測に基づく意思決定を保証することで、レジリエンスを実現。

実験結果

リサーチクエスチョン

  • RQ1腐敗レベル $C$ の事前知識がなくても、敵対的汚染下でも近似的に最適なレグレットを維持できる確率的バンディットアルゴリズムを設計できるか?
  • RQ2腐敗レベル $C$ に乗法的ではなく加法的依存でレグレットがスケーリングできるか。これにより、高腐敗下でも性能が保たれるか?
  • RQ3腐敗レベルのチューニングや事前仮定が不要な、シンプルでアーギノスティックなアルゴリズムを構築できるか?
  • RQ4敵対的汚染下での確率的バンディットにおいて、腐敗に対するレジリエンスとレグレットの根本的トレードオフは何か?
  • RQ5レジリエンスを維持したまま、$ ext{polylog}(T)$ 依存を排除できるレグレットバウンドを改善できるか?

主な発見

  • 提案された BARBAR アルゴリズムは、高確率で $O(KC) + \widetilde{O}\left(\sum_{i \neq i^*} \frac{1}{\Delta_i}\right)$ のレグレットバウンドを達成する。これは $C$ に対して加法的である。
  • このバウンドは、従来の最先端の $\widetilde{O}(KC \sum_{i \neq i^*} \frac{1}{\Delta_i})$ のバウンドを改善し、乗法的 $C$ 要因を削除している。
  • アルゴリズムは $C$ に対してアーギノスティックであり、腐敗レベルの事前知識が不要で、$C$ が大きくても良好に動作する。
  • $Δ_i = \sqrt{K/T}$ の困難なインスタンスにおいて、$C = O(\sqrt{T/K})$ のとき BARBAR は $\widetilde{O}(\sqrt{KT})$ のレグレットを達成し、腐敗なしの場合と一致する。
  • 従来の手法は $C = O(1)$ でも著しく劣化し、$C = \Omega(\sqrt{T/K})$ では意味をなさなくなるのに対し、BARBAR は優れた性能を示す。
  • レグレットに対する下界 $Ω(C)$ が確立され、上界における加法的依存がほぼタイトであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。