Skip to main content
QUICK REVIEW

[論文レビュー] Bayesian Reinforcement Learning via Deep, Sparse Sampling

Divya Grover, Debabrota Basu|arXiv (Cornell University)|Feb 7, 2019
Reinforcement Learning in Robotics参考文献 21被引用数 4
ひとこと要約

本稿では、信念状態上でより深いかつ疎な計画木を構築するために方策サンプリングを用いるBayesian強化学習アルゴリズムDSS(Deeper Sparser Sampling)を提案する。この手法により、計算コストを著しく低減しつつ、楽観主義に依存しない探索が可能となり、最先端の性能を達成する。個々の行動ではなく長期的なオプションをサンプリングすることで、計算コストを大幅に削減し、Bayes最適方策との相対的な部分最適性のPACスタイルの理論的境界を提供する。

ABSTRACT

We address the problem of Bayesian reinforcement learning using efficient model-based online planning. We propose an optimism-free Bayes-adaptive algorithm to induce deeper and sparser exploration with a theoretical bound on its performance relative to the Bayes optimal policy, with a lower computational complexity. The main novelty is the use of a candidate policy generator, to generate long-term options in the planning tree (over beliefs), which allows us to create much sparser and deeper trees. Experimental results on different environments show that in comparison to the state-of-the-art, our algorithm is both computationally more efficient, and obtains significantly higher reward in discrete environments.

研究の動機と目的

  • Bayesian強化学習におけるBayes最適計画の計算不能性に対処し、信念状態上でより深いかつ疎な木の拡張を可能にする。
  • 不確実性の面前での楽観主義に依存しないようにし、探索を方策サンプリングによって誘導する。
  • 計算複雑性を低減しつつ、Bayes最適方策との性能に関する強い理論的保証を維持する。
  • 従来の最先端手法と比較して、離散MDP環境におけるサンプル効率の向上と長期的報酬の蓄積を改善する。

提案手法

  • ノードが情報状態を表す信念木を構築し、個々の行動ではなく、長期間にわたる方策全体をサンプリングする候補方策生成器を用いる。
  • 各計画ステップで、期待報酬が高いために限定された数の高期待報酬方策のみをサンプリング・拡張し、分岐率を著しく低減することで、より深い木の成長を可能にする。
  • DSS方策とBayes最適方策との間の部分最適性ギャップを制限するため、PAC(おそらく近似的に正しい)計画フレームワークを採用する。
  • MDPモデルの事後分布から、Thompsonサンプリングに類似した方策サンプリングを用い、木の拡張に適した多様で高品質なオプションを生成する。
  • BFS3のように信念ノードの上限・下限を維持するのではなく、DSSは事後分布から直接サンプリングして行動を選択するため、計算を簡略化する。
  • Kステップの計画ホライズンを想定し、各Kステップごとに方策を更新することで、1ステップあたりの計算負荷を低減しながらも、長期的な性能を維持する。

実験結果

リサーチクエスチョン

  • RQ1方策レベルのサンプリングを用いて、探索効率を向上させるために、より深いかつ疎な計画木を構築できるか?
  • RQ2不確実性の面前での楽観主義を排除することで、信念MDP計画においてより良い長期的性能とより低い計算コストが達成できるか?
  • RQ3提案されたDSSアルゴリズムとBayes最適方策との間の理論的部分最適性ギャップは何か?また、計画深さKに伴いどのようにスケーリングされるか?
  • RQ4BAMCP、BFS3、SBOSSといった最先端のBAMDPアルゴリズムと比較して、DSSは報酬および計算効率の両面でどのように異なるか?
  • RQ5行動レベルのサンプリングではなく方策サンプリングを用いることで、真のモデルへの収束が速くなり、より高い累積報酬が得られるか?

主な発見

  • DSSは、Chain、DoubleLoop、Grid5、Grid10、Mazeを含むすべてのテスト環境で、累積報酬においてすべての最先端手法を上回り、統計的に有意な向上を示した。
  • Maze環境では、DSSの平均累積報酬は1532.0であったが、BAMCP(1789.4)とBFS3(3558.7)を上回った。ただし、BFS3は時間制限を超え、DSSの優れた効率性が示された。
  • DSSは、特に初期学習段階において、すべてのベースラインより高い平均ステップ報酬を達成し、優れた探索能力を示した。
  • 計算面では、BFS3と比較して、1エピソードあたりの時間を大幅に削減し、BAMCPでさえもサンプリング量が増加するにつれて性能が低下する中で、DSSはしばしばそれを上回った。
  • ハイパーパrameter NとMを増加させても、DSSの性能は速やかに飽和したため、高速収束性とパrameterチューニングに対するロバストネスが示された。
  • 理論的分析により、DSSとBayes最適方策との間の部分最適性ギャップが有界であり、計画深さKが増加するにつれて減少することが確認され、強力なPACスタイルの保証が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。