Skip to main content
QUICK REVIEW

[論文レビュー] Instance-Dependent Complexity of Contextual Bandits and Reinforcement Learning: A Disagreement-Based Perspective

Dylan J. Foster, Alexander Rakhlin|arXiv (Cornell University)|Oct 7, 2020
Advanced Bandit Algorithms Research参考文献 73被引用数 21
ひとこと要約

本稿は、関数近似を伴うコンテキストバンディットおよび強化学習におけるインスタンス依存のレギュレートを特徴付けるための、意見の食い違いに基づくフレームワークを導入する。また、可能な限り報酬ギャップに適応する、オракル効率の良いアルゴリズムを提案し、最適なギャップ依存のサンプル複雑度を達成するとともに、最悪ケースにおいてもミニマックスレートを維持する。

ABSTRACT

In the classical multi-armed bandit problem, instance-dependent algorithms attain improved performance on "easy" problems with a gap between the best and second-best arm. Are similar guarantees possible for contextual bandits? While positive results are known for certain special cases, there is no general theory characterizing when and how instance-dependent regret bounds for contextual bandits can be achieved for rich, general classes of policies. We introduce a family of complexity measures that are both sufficient and necessary to obtain instance-dependent regret bounds. We then introduce new oracle-efficient algorithms which adapt to the gap whenever possible, while also attaining the minimax rate in the worst case. Finally, we provide structural results that tie together a number of complexity measures previously proposed throughout contextual bandits, reinforcement learning, and active learning and elucidate their role in determining the optimal instance-dependent regret. In a large-scale empirical evaluation, we find that our approach often gives superior results for challenging exploration problems. Turning our focus to reinforcement learning with function approximation, we develop new oracle-efficient algorithms for reinforcement learning with rich observations that obtain optimal gap-dependent sample complexity.

研究の動機と目的

  • 特別なケースを除き、コンテキストバンディットにおけるインスタンス依存のレギュレートバウンドの一般理論の欠如に取り組む。
  • インスタンス依存のレギュレート保証を達成するために、必要かつ十分な複雑度測度を構築する。
  • 報酬ギャップに適応しつつ、最悪ケース設定においてミニマックス最適性を維持するオラクル効率の良いアルゴリズムを設計する。
  • コンテキストバンディット、強化学習、アクティブラーニングの文脈において、さまざまな複雑度測度(例:エリューダー次元、スターナンバー)の役割を統合的かつ明確化する。
  • 豊富な観測を伴う強化学習にこのフレームワークを拡張し、最適なギャップ依存のサンプル複雑度を達成する。

提案手法

  • 報酬ギャップに関連して、ポリシークラスの統計的容量を測るための意見の食い違い係数を導入する。
  • インスタンス固有の難易度を捉える新しい複雑度測度の族(例:ポリシー意見の食い違い係数、スターナンバー、エリューダー次元)を提案する。
  • 回帰オラクルを用いて価値関数を推定し、報酬ギャップに動的に適応するオラクル効率の良いアルゴリズムを設計する。
  • 集中不等式と情報理論的ツールを用いて、分布に依存しないおよびスケールに敏感なレギュレートバウンドを確立する。
  • 信頼集合と最小二乗推定を活用して、関数近似を伴う強化学習における近似誤差とオフセット誤差をバウンドする。
  • 和集合の不等式と一様性の議論を用いて、関数クラスからそのスターハルに結果を拡張し、一般化を向上させる。

実験結果

リサーチクエスチョン

  • RQ1コンテキストバンディットにおけるインスタンス依存のレギュレートバウンドを達成するための、必要かつ十分な複雑度測度は何か?
  • RQ2報酬ギャップに適応しつつミニマックス最適性を維持するオラクル効率の良いアルゴリズムは設計可能か?
  • RQ3エリューダー次元やスターナンバーといった既存の複雑度測度は、インスタンス依存学習の文脈においてどのように関係しているか?
  • RQ4豊富な観測を伴う強化学習における最適なギャップ依存のサンプル複雑度は何か?
  • RQ5意見の食い違いに基づく分析は、コンテキストバンディット、強化学習、アクティブラーニングの理論的保証を統合的に可能にするか?

主な発見

  • 本稿は、コンテキストバンディットにおけるインスタンス依存のレギュレートバウンドに対して、ポリシー意見の食い違い係数が必要かつ十分であることを確立した。
  • 提案されたアルゴリズムは、正のギャップを持つ容易なインスタンスでは対数的レギュレートを達成するが、最悪ケースにおいても $\sqrt{T}$ のミニマックスレートを維持する。
  • スターナンバーと呼ばれる新しい複雑度測度が、意見の食い違い係数と密接に結びついており、学習の難易度の構造的特徴付けを提供することが示された。
  • 豊富な観測を伴う強化学習において、アルゴリズムは最適なギャップ依存のサンプル複雑度を達成し、既知の下界と一致する。
  • 実験的評価により、ベースライン手法と比較して、挑戦的な探索問題において優れた性能を示した。
  • 理論的分析により、エリューダー次元とスターナンバーが、より包括的な意見の食い違いに基づくフレームワークの特殊ケースであることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。