Skip to main content
QUICK REVIEW

[論文レビュー] Model Based Planning with Energy Based Models

Yilun Du, Toru Lin|arXiv (Cornell University)|Sep 15, 2019
Reinforcement Learning in Robotics参考文献 33被引用数 5
ひとこと要約

この論文では、強化学習におけるモデルベースの計画にエネルギーに基づくモデル(EBM)を用いることを提案しており、オンライン学習と状態軌道上の最大エントロピー推論を可能にしている。EBMはオンライン学習においてフィードフォワードネットワークを上回り、未確認の障害物に対しても一般化性能が高く、未探索で到達可能な状態に低いエネルギーを割り当てることで、自然に方向性のある探索を促進する。

ABSTRACT

Model-based planning holds great promise for improving both sample efficiency and generalization in reinforcement learning (RL). We show that energy-based models (EBMs) are a promising class of models to use for model-based planning. EBMs naturally support inference of intermediate states given start and goal state distributions. We provide an online algorithm to train EBMs while interacting with the environment, and show that EBMs allow for significantly better online learning than corresponding feed-forward networks. We further show that EBMs support maximum entropy state inference and are able to generate diverse state space plans. We show that inference purely in state space - without planning actions - allows for better generalization to previously unseen obstacles in the environment and prevents the planner from exploiting the dynamics model by applying uncharacteristic action sequences. Finally, we show that online EBM training naturally leads to intentionally planned state exploration which performs significantly better than random exploration.

研究の動機と目的

  • モデルフリー強化学習における低いサンプル効率と一般化性能の欠如を、学習済みダイナミクスを用いたモデルベースの計画に採用することで解決する。
  • 行動条件付き計画の限界を克服する。行動条件付き計画はモデルの不正確さを悪用し、未確認の障害物に対して失敗する可能性がある。
  • 変化するダイナミクスと現実世界の相関のある経験に適応できる、EBMのオンライン学習フレームワークを開発する。
  • EBMの学習により内発的探索を可能にする。未探索領域に低いエネルギーを割り当てることで、自然に新たな領域を標的とする。
  • 行動条件なしに状態空間での計画が行われることで、より良い一般化性能と安全で多様な軌道が得られることを示す。

提案手法

  • エネルギーに基づくモデルが定義するグラフィカルモデルにおける推論として計画を定式化し、エネルギー関数が状態遷移の尤度を符号化する。
  • 実際の遷移と、逸脱する前の計画された遷移の両方を用いて、EBMをオンラインで学習する。コントラスト型の目的関数により、実際の遷移と妥当な計画された遷移のエネルギーを最小化する。
  • ランジュバンダイナミクスや類似のサンプリング手法を用いて、状態軌道上の最大エントロピー推論を実行し、開始状態から目的状態への多様な計画を生成する。
  • ポリシー学習とダイナミクスモデリングを分離する。計画を開始状態と目的状態にのみ条件づけることで、行動空間の悪用を回避する。
  • EBMの構成的およびオンライン学習特性を活用し、訓練中に相関のある非i.i.d.経験に対しても頑健性を維持する。
  • EBMが未探索だが到達可能な状態に低いエネルギーを割り当てることで、探索のインcentiveを組み込む。これにより、エージェントは新しい領域へ誘導される。

実験結果

リサーチクエスチョン

  • RQ1エネルギーに基づくモデルは、相関のある経験を伴う現実世界の非定常環境において、ダイナミクスの効果的なオンライン学習を可能にするか?
  • RQ2未確認の障害物に直面した際、EBMを用いた状態空間での計画が、行動条件付き計画よりも一般化性能が優れているか?
  • RQ3EBMベースの計画は、明示的な報酬形状付けや探索ボーナスなしに、自然に多様で高品質な軌道を生成できるか?
  • RQ4オンラインEBM学習は、ランダム探索や内発的動機づけベースの方法と比較して、どれほどより方向性があり、効率的な探索をもたらすか?
  • RQ5EBMの最大エントロピー特性は、状態空間計画における頑健性と多様性をどのように向上させるか?

主な発見

  • EBMは、対応するフィードフォワードネットワークと比較して、オンラインモデル学習において顕著に優れており、相関のある経験に対してより頑健で、収束が速い。
  • EBMベースの計画は、未確認の障害物に対しても一般化性能が優れている。粒子環境では、EBMが-61.94の報酬を達成した一方、行動条件付きフィードフォワードネットワークは-81.24であった。
  • EBMベースの計画は多様な軌道を生成する。複数ステップの計画において、可能なパスの幅広いエナメルが観察され、リーチャー環境では時計回りと反時計回りの両方のパスを生成可能である。
  • EBMは自然に探索を促進する。迷路環境では、EBMガイドド探索が10,000トランジション未満で迷路全体をカバーしたが、ランダムポリシーは最大空間的被覆率に到達するまでに200,000トランジション以上を要した。
  • ソーヤーロボットアームタスクでは、EBMはランダム探索よりもはるかに少ないトランジションで最大3Dエンドエフェクターオンライン(116ボクセル)に到達した。これは、方向性があり、効率的な探索を示している。
  • 訓練中に未探索領域のエネルギー値が変動することで、EBMは以前に訪問されていないが到達可能な状態へ向かう計画を生成するようになり、動的な探索インセンティブが生じる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。