Skip to main content
QUICK REVIEW

[論文レビュー] An Experimental Design Perspective on Model-Based Reinforcement Learning

Viraj Mehta, Biswajit Paria|arXiv (Cornell University)|Dec 9, 2021
Machine Learning and Algorithms被引用数 4
ひとこと要約

本論文は、計算コストや資金的コストがかかる遷移関数における問い合わせに、最も情報量の多い状態-行動ペアを選択するためにベイジアン最適実験設計を用いるデータ効率の良い強化学習アルゴリズムを提案する。最適方策の軌道に関する期待情報量の増加を最大化することで、連続制御およびプラズマ制御タスクにおいて、モデルベースのベースラインと比較して最大1,000倍、モデルフリー手法と比較して10⁵倍のサンプル効率の向上を達成する。

ABSTRACT

In many practical applications of RL, it is expensive to observe state transitions from the environment. For example, in the problem of plasma control for nuclear fusion, computing the next state for a given state-action pair requires querying an expensive transition function which can lead to many hours of computer simulation or dollars of scientific research. Such expensive data collection prohibits application of standard RL algorithms which usually require a large number of observations to learn. In this work, we address the problem of efficiently learning a policy while making a minimal number of state-action queries to the transition function. In particular, we leverage ideas from Bayesian optimal experimental design to guide the selection of state-action queries for efficient learning. We propose an acquisition function that quantifies how much information a state-action pair would provide about the optimal solution to a Markov decision process. At each iteration, our algorithm maximizes this acquisition function, to choose the most informative state-action pair to be queried, thus yielding a data-efficient RL approach. We experiment with a variety of simulated continuous control problems and show that our approach learns an optimal policy with up to $5$ -- $1,000 imes$ less data than model-based RL baselines and $10^3$ -- $10^5 imes$ less data than model-free RL baselines. We also provide several ablated comparisons which point to substantial improvements arising from the principled method of obtaining data.

研究の動機と目的

  • 各状態遷移の問い合わせに計算的・経済的コストがかかる環境における強化学習の高いサンプル複雑性に対処すること。
  • 最適方策の学習に寄与する期待貢献度に基づいてクエリを優先するデータ選択戦略を開発し、単に動的モデルの改善を目的としないこと。
  • モデルベース強化学習における連続的かつ高次元のマークフ・決定過程に、ベイジアン最適実験設計を拡張すること。
  • シミュレーションが高価な実世界の応用、例えば核融合プラズマ制御において、効率的な学習を可能にすること。
  • 挑戦的な環境でも安定性を保ちながら、既存のモデルベースおよびモデルフリーRLベースラインを上回るサンプル効率を達成すること。

提案手法

  • 最適方策の軌道に関する期待情報量(EIG)に基づく新規の獲得関数EIGτ*を提案する。
  • 動的モデルの事後分布サンプルを用いて、新たなクエリによる最適方策軌道に関する不確実性の期待的低減を推定する。
  • EIGτ*を最大化する状態-行動ペアを選択し、遷移関数の逐次的問い合わせを制御する遷移クエリRL(TQRL)設定を実現する。
  • 不確実性を定量化し、クエリ選択を支援するために、現在の実装ではガウス過程を用いたベイジアン動的モデルを採用する。
  • 最小限のクエリで繰り返し方策と動的モデル推定を改善するモデルベースRLフレームワークに獲得関数を統合する。
  • 事後分布サンプル上のMPCベースのロールアウトを用いて、各潜在的クエリが方策性能に与える影響を推定する。

実験結果

リサーチクエスチョン

  • RQ1最適方策軌道に関する期待情報量が、データ効率の良いRLのための有効な獲得関数として機能するか。
  • RQ2EIGτ*に基づくクエリ選択が、標準のMBRLおよびMFRLベースラインと比較して顕著に低いサンプル複雑性を実現するか。
  • RQ3本手法が、高次元で挑戦的な環境(例えばラバパスやプラズマ制御を含む)を含む多様な連続制御タスクに一般化可能か。
  • RQ4EIGτ*は、動的モデルに関する期待情報量(EIGT)のような代替獲得関数と比較して、データ効率および方策性能の面で優れているか。
  • RQ5獲得計算の過程で、目標軌道を生成する際に劣化した方策を使用した場合、本手法の有効性はどの程度保たれるか。

主な発見

  • 提案されたBARLアルゴリズムは、連続制御タスクにおいて、モデルベースRLベースラインと比較して最大1,000倍のサンプル複雑性の低減を達成する。
  • BARLは、モデルフリーRLベースラインと比較して、データ要件を10³〜10⁵倍まで削減し、優れたデータ効率を示す。
  • 困難なラバパス環境では、BARLは数回のクエリで安全な方策を学習するのに対し、他の手法は不安定性と劣悪な探索により失敗する。
  • BARLはEIGTやMPCベースのベースラインを上回り、均一に状態空間を探索するのではなく、方策に関連する領域にクエリを集約することで優位性を発揮する。
  • ランダムデータにおける一般化誤差が悪化しても、BARLは動的モデルの改善ではなく方策の向上に寄与するデータを優先するため、優れた制御性能を達成する。
  • アブレーションスタディにより、EIGτ*がEIGTやMPCベースの戦略よりも効果的であることが確認され、特に高次元または滑らかでない環境(例:リーチャーやベータトラッキング)において顕著である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。