Skip to main content
QUICK REVIEW

[論文レビュー] Regret Bound Balancing and Elimination for Model Selection in Bandits and RL

Aldo Pacchiano, Christoph Dann|arXiv (Cornell University)|Dec 24, 2020
Advanced Bandit Algorithms Research参考文献 18被引用数 12
ひとこと要約

本稿では、確率的バンディットおよび強化学習におけるモデル選択フレームワークを提案する。このフレームワークは、レグレットの上限をバランスさせるとともに、非最適なベースアルゴリズムを統計的検定によって排除する。その結果、最良の有効な候補レグレット上限の定数倍に抑えられたレグレットが達成され、ギャップ仮定のもとで近似的に最適な性能を発揮し、i.i.d. でない環境に対しても拡張可能である。

ABSTRACT

We propose a simple model selection approach for algorithms in stochastic bandit and reinforcement learning problems. As opposed to prior work that (implicitly) assumes knowledge of the optimal regret, we only require that each base algorithm comes with a candidate regret bound that may or may not hold during all rounds. In each round, our approach plays a base algorithm to keep the candidate regret bounds of all remaining base algorithms balanced, and eliminates algorithms that violate their candidate bound. We prove that the total regret of this approach is bounded by the best valid candidate regret bound times a multiplicative factor. This factor is reasonably small in several applications, including linear bandits and MDPs with nested function classes, linear bandits with unknown misspecification, and LinUCB applied to linear bandits with different confidence parameters. We further show that, under a suitable gap-assumption, this factor only scales with the number of base algorithms and not their complexity when the number of rounds is large enough. Finally, unlike recent efforts in model selection for linear stochastic bandits, our approach is versatile enough to also cover cases where the context information is generated by an adversarial environment, rather than a stochastic one.

研究の動機と目的

  • 最適な設定が事前に不明な複数のバンディットまたは強化学習アルゴリズムの中から選択する課題に対処すること。
  • 最適なレグレットを事前に知る必要がある従来の手法の制限を克服すること。
  • 環境の構造に関する事前知識なしに、オンラインで最良のベースアルゴリズムに適応する汎用的なマスターアルゴリズムを開発すること。
  • 一部のベースアルゴリズムが誤って指定されている場合でも、最良の有効なベースアルゴリズムと同等のレグレット上限を達成すること。
  • i.i.d. でない文脈に対しても、フレームワークを拡張し、耐障害性を確保すること。

提案手法

  • 各ベースアルゴリズムに、実際には成り立つとは限らない候補レグレット上限を保持する。
  • 各ラウンドにおいて、残存するすべてのアルゴリズムの候補レグレット上限をバランスさせるように、ベースアルゴリズムを選択する。
  • 統計的検定を用いて、候補レグレット上限に違反するベースアルゴリズムを検出し、排除する。
  • 信頼区間の違反に基づいて動的に探索を調整するエポックベースのバランスサブルーチンを採用する。
  • ネストされたモデルクラス(例:次元数が異なる線形バンディット)やハイパーパramータチューニング(例:OFULにおける信頼パラメータ)にこの手法を適用する。
  • ランダム化されたバランスメカニズムを用いて、アドバーシャル文脈への拡張を図り、耐障害性を確保する。

実験結果

リサーチクエスチョン

  • RQ1最適なレグレットを事前に知らない状況でも、最良の有効な候補レグレット上限に近いレグレットを達成できるモデル選択アルゴリズムは存在するか?
  • RQ2レグレットのバランスと排除をどのように組み合わせることで、代替となるベースアルゴリズムの中から最良のものを自動的に選択できるか?
  • RQ3異なるベースアルゴリズムのレグレット上限のギャップが、マスターアルゴリズムの性能に与える影響は何か?
  • RQ4文脈列がi.i.d.でないアドバーシャル文脈に対しても、この手法を拡張できるか?
  • RQ5レグレット上限に含まれる乗数要因は、ベースアルゴリズムの数やその複雑さにどのように依存するか?

主な発見

  • 提案されたマスターアルゴリズムの総レグレットは、最良の有効な候補レグレット上限に小さな乗数をかけたもので抑えられる。
  • ギャップ仮定のもとで、ラウンド数が十分に大きい場合、乗数要因はベースアルゴリズムの数にのみ依存し、その複雑さには依存しない。
  • ネストされたモデルクラスを用いた線形バンディットでは、レグレット上限が近似的に最適であり、後向きに最良のベースアルゴリズムの性能と一致する。
  • 異なる信頼パラメータを用いたOFULのケースでは、最良の設定に近いレグレットが達成される。
  • ランダム化されたエポックバランスサブルーチンを用いることで、フレームワークはアドバーシャル文脈へ拡張可能であり、レグレットの保証を維持する。
  • レグレット上限には、$\tilde{O}(\sqrt{B}M(d_{\star} + \sqrt{d_{\star}}S_{\star})\sqrt{T})$ とスケーリングする項が含まれる。ここで $B$ は誤って指定されたモデルの数、$M$ はベースアルゴリズムの数を表す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。