Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Model-Based Reinforcement Learning through Optimistic Policy Search and Planning

Sebastian Curi, Felix Berkenkamp|arXiv (Cornell University)|Jun 15, 2020
Advanced Bandit Algorithms Research被引用数 15
ひとこと要約

本稿では、知識的不確実性の制御を想起させるようにモデル空間を再パrameter化することにより、効率的な楽観的探索を可能にする新しいモデルベース強化学習アルゴリズム、H-UCRLを提案する。これらの想起された入力を含む拡張された入力空間を用いることで、H-UCRLは楽観的探索をグリーディな計画に変換し、ガウス過程モデルを用いた場合に証明可能な部分線形のリグレットを達成するとともに、アクションペナルティが課される高次元制御タスクにおけるサンプル効率を著しく向上させる。

ABSTRACT

Model-based reinforcement learning algorithms with probabilistic dynamical models are amongst the most data-efficient learning methods. This is often attributed to their ability to distinguish between epistemic and aleatoric uncertainty. However, while most algorithms distinguish these two uncertainties for learning the model, they ignore it when optimizing the policy, which leads to greedy and insufficient exploration. At the same time, there are no practical solvers for optimistic exploration algorithms. In this paper, we propose a practical optimistic exploration algorithm (H-UCRL). H-UCRL reparameterizes the set of plausible models and hallucinates control directly on the epistemic uncertainty. By augmenting the input space with the hallucinated inputs, H-UCRL can be solved using standard greedy planners. Furthermore, we analyze H-UCRL and construct a general regret bound for well-calibrated models, which is provably sublinear in the case of Gaussian Process models. Based on this theoretical foundation, we show how optimistic exploration can be easily combined with state-of-the-art reinforcement learning algorithms and different probabilistic models. Our experiments demonstrate that optimistic exploration significantly speeds-up learning when there are penalties on actions, a setting that is notoriously difficult for existing model-based reinforcement learning algorithms.

研究の動機と目的

  • 知識的不確実性下で効果的に探索できないという、モデルベース強化学習におけるグリーディな方策最適化の限界を解決すること。
  • トムソンサンプリングや事後サンプリングが非効率的となる深層モデルベース強化学習において、楽観的探索を実装可能な実用的アルゴリズムを開発すること。
  • モデル再パラメータ化により楽観的探索をグリーディな活用に還元し、標準的なプランナを用いることを可能とすること。
  • 良好にキャリブレーションされたモデルに対して一般化されたリグレットバウンドを提供すること。特にガウス過程ダイナミクスに対して部分線形のリグレットが証明されること。
  • アクションペナルティが課される挑戦的な環境において、楽観的探索が学習を加速することを実験的に検証すること。

提案手法

  • 知識的不確実性を制御変数として表現するため、平均-知識的分散分解を用いてモデル空間を再パラメータ化する。
  • エージェントの1ステップ遷移ダイナミクスに関する不確実性を直接操作できる想起された制御行動を導入する。
  • 想起された入力を含む拡張された入力空間により、標準的なグリーディプランナが楽観的計画問題を解けるようになる。
  • 仮定2の下で、事後分散に基づく信頼区間を用いることで、良好にキャリブレーションされた不確実性推定を保証する。
  • 理論的分析により、情報容量とドメイン成長に依存するリグレットバウンドを導出する。時間に対して対数スケーリングがなされる。
  • ガウス過程、ニューラルネットワークアンサンブル、決定論的モデルを含む、さまざまな確率的モデルと互換性がある。

実験結果

リサーチクエスチョン

  • RQ1複雑な確率的モデルを用いた深層モデルベース強化学習において、楽観的探索を効率的に実装できるか。
  • RQ2理論的保証を損なわずに、モデル再パラメータ化により楽観的探索をグリーディな計画に変換できるか。
  • RQ3良好にキャリブレーションされたモデル、特にガウス過程ダイナミクスにおいて、H-UCRLは部分線形のリグレットを達成するか。
  • RQ4アクションペナルティが課される環境において、H-UCRLはグリーディ法やトムソンサンプリングベースの手法と比較して優れているか。
  • RQ5探索がコストペナルティによって妨げられる高次元連続制御タスクを、H-UCRLは信頼性を持って解けるか。

主な発見

  • H-UCRLはガウス過程モデルに対して、証明可能な部分線形リグレットを達成し、リグレットは $\mathcal{O}(\beta_{T-1}^{N}L_{\sigma}^{N}N^{2}\sqrt{T\,p\,\gamma_{pTN}(\mathbb{B}(\mathbf{s}_{0},b_{t})\times\mathcal{A}\times\mathcal{I}_{p})})$ のスケーリングを示す。
  • GPモデルの情報容量は時間に対して対数的に増加し、固定ドメインと比較してリグレットバウンドに追加の対数要因しか与えない。
  • 実験では、H-UCRLが増加するアクションペナルティ下でインバーテッドペンドルのスイングアップタスクを正常に解くことができ、グリーディ法やトムソンサンプリング法では失敗している。
  • 特に探索がペナルティを受ける状況では、H-UCRLはグリーディ法やトムソンサンプリングベースのベースラインを上回る性能を示す。
  • H-UCRLは、決定論的モデル、確率的ニューラルネットワークアンサンブル、ガウス過程など、多様なモデルと互換性があり、広範な適用可能性を示している。
  • 理論的分析により、予測分散が有界で、状態空間がコンパクトな良好にキャリブレーションされたモデルは、有効なリグレットバウンドを保証することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。