Skip to main content
QUICK REVIEW

[論文レビュー] Residual Bootstrap Exploration for Bandit Algorithms

Chi‐Hua Wang, Yang Yu|arXiv (Cornell University)|Feb 19, 2020
Advanced Bandit Algorithms Research参考文献 12被引用数 5
ひとこと要約

本稿では、残差に基づく分散拡張機構を通じてデータ駆動型のランダムネスを注入することで、探索を強化する、バンドイットアルゴリズム向けの新しい摂動ベース探索手法であるResidual Bootstrap Exploration(ReBoot)を提案する。ReBootはガウス分布に従うマルチアームバンドイットにおいて、インスタンス依存の対数的リグレットを達成し、報酬が有界でない設定でもGiroやPHEを上回る性能を示す一方で、トムソンサンプリングと同等の計算効率を維持する。

ABSTRACT

In this paper, we propose a novel perturbation-based exploration method in bandit algorithms with bounded or unbounded rewards, called residual bootstrap exploration ( exttt{ReBoot}). The exttt{ReBoot} enforces exploration by injecting data-driven randomness through a residual-based perturbation mechanism. This novel mechanism captures the underlying distributional properties of fitting errors, and more importantly boosts exploration to escape from suboptimal solutions (for small sample sizes) by inflating variance level in an extit{unconventional} way. In theory, with appropriate variance inflation level, exttt{ReBoot} provably secures instance-dependent logarithmic regret in Gaussian multi-armed bandits. We evaluate the exttt{ReBoot} in different synthetic multi-armed bandits problems and observe that the exttt{ReBoot} performs better for unbounded rewards and more robustly than exttt{Giro} \cite{kveton2018garbage} and exttt{PHE} \cite{kveton2019perturbed}, with comparable computational efficiency to the Thompson sampling method.

研究の動機と目的

  • 報酬分布が有界でない場合を含め、幅広い分布に適応可能な一般化可能でデータ駆動型の探索メカニズムをバンドイットアルゴリズムに開発すること。
  • Giro や PHE のような従来のブートストラップベース手法が固定された擬似報酬に依存しており、報酬が有界でない、または分散が不均一な場合に失敗するという限界を是正すること。
  • 小標本領域における探索を明示的に強化し、劣悪なアームから脱出できるように、理論的に保証可能な分散拡張スキームを設計すること。
  • 特にガウス分布バンドイットにおいて、ReBootの理論的リグレット保証を確立すること。
  • 多様な報酬分布および分散レベルにおいて、ReBootのロバストネスと計算効率を実験的に検証すること。

提案手法

  • ReBootは、残差平方和(RSS)を用いてフィッティング誤差の分布をモデル化することで、残差に基づく摂動を用い、データ駆動型のランダムネスを注入する。
  • 残差の分散を拡張することで、不確実性を高め、特に初期学習段階での探索を促進する。
  • 本手法は「ブートストラップ・リーダーに従う」アルゴリズムとして定式化され、分散が拡張されたブートストラップ報酬推定値に基づいて行動が選択される。
  • 調整パrameter $\sigma_a$ が分散拡張のレベルを制御し、ガウス分布バンドイットにおける最適性能を達成するための理論的指針が与えられる。
  • Giro や PHE が繰り返しブートストラップサンプルを必要とするのに対し、ReBootは1ラウンドにつき1回のリサンプリングで済ませることで、計算効率を維持する。
  • UCB や TS がスケーラビリティの問題を抱えるのに対し、ReBootは構造的・非線形なバンドイット問題にも一般化可能に設計されている。

実験結果

リサーチクエスチョン

  • RQ1データ駆動型の分散拡張を伴う残差ブートストラップ機構は、有界でない報酬バンドイットにおいて最適なリグレットを達成できるか?
  • RQ2平均シフトや分散の不均一性に対して、ReBootはGiro や PHE よりもロバストか?
  • RQ3分散拡張パラメータ $\sigma_a$ が、異なる報酬分布におけるリグレットとパフォーマンスに与える影響は何か?
  • RQ4ReBootは、トムソンサンプリングと同等の計算効率を維持しながら、有界でない設定でそれを上回る性能を示せるか?
  • RQ5ReBootの残差に基づく摂動機構は、小標本領域において劣悪なアームから脱出するのに効果的か?

主な発見

  • ReBootはガウス分布に従うマルチアームバンドイットにおいて、インスタンス依存の対数的リグレットを達成し、有界でない報酬に対する最適な理論的性能を実証した。
  • 平均シフトや分散の変動が生じる実験では、ReBootはロバストである一方、Giro や PHE は固定された擬似報酬仮定に起因する性能劣化を示した。
  • 指数分布およびロジスティック分布バンドイットにおいて、ReBootは $\sigma_a = 1.5$ で線形より良いリグレットを維持し、ガウス分布を超える一般化可能性を裏付けた。
  • ReBootのリグレットは分散の増加に伴いゆっくりと増加するが、PHE よりも優れており、ベルヌーイノイズに依存するため分散変化に極めて感受しやすい。
  • 計算ベンチマークでは、ReBootはトムソンサンプリングやPHEと同等の実行時間を維持しており、Giro は擬似報酬の繰り返しリサンプリングのため著しく遅い。
  • ガウス分布および指数分布バンドイットでは最適な $\sigma_a$ 値は $1.5$ であり、ロジスティック分布では $\sigma_a = 1$ がわずかに優れていた。これは調整パラメータの感受性を示しながらも、強い実験的パフォーマンスを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。