Skip to main content
QUICK REVIEW

[論文レビュー] Information Theoretic Model Predictive Q-Learning

Mohak Bhardwaj, Ankur Handa|arXiv (Cornell University)|Dec 31, 2019
Advanced Control Systems Optimization参考文献 40被引用数 6
ひとこと要約

この論文では、情報理論的モデル予測制御(MPC)とエントロピー正則化Q学習を組み合わせることで、強化学習におけるサンプル効率とロバスト性を向上させる、新しいアルゴリズムであるModel Predictive Q-Learning(MPQ)を提案する。実世界のロールアウトを用いてQ関数を学習すると同時に、MPCを用いて安定的かつ長期間にわたる計画を実施することで、MPQは、モデルバイアスやスパarselyな報酬がある状況下でも、MPCやソフトQ学習を上回る高速な収束と優れた性能を達成する。

ABSTRACT

Model-free Reinforcement Learning (RL) works well when experience can be collected cheaply and model-based RL is effective when system dynamics can be modeled accurately. However, both assumptions can be violated in real world problems such as robotics, where querying the system can be expensive and real-world dynamics can be difficult to model. In contrast to RL, Model Predictive Control (MPC) algorithms use a simulator to optimize a simple policy class online, constructing a closed-loop controller that can effectively contend with real-world dynamics. MPC performance is usually limited by factors such as model bias and the limited horizon of optimization. In this work, we present a novel theoretical connection between information theoretic MPC and entropy regularized RL and develop a Q-learning algorithm that can leverage biased models. We validate the proposed algorithm on sim-to-sim control tasks to demonstrate the improvements over optimal control and reinforcement learning from scratch. Our approach paves the way for deploying reinforcement learning algorithms on real systems in a systematic manner.

研究の動機と目的

  • 現実世界のロボット工学における、モデルフリー強化学習(サンプル非効率性)とモデルベース強化学習(モデルバイアス)の限界を解消すること。
  • 高価な実世界の相互作用と不完全な動的モデルを持つ制御タスクにおけるサンプル効率とロバスト性を向上させること。
  • モデルバイアスを補正するための実世界データを活用しながら、MPCの計画的利点を維持する手法を開発すること。
  • 実システムのロールアウトから学習したQ関数が、ドメインランダマイゼーションやモデルベースのベースラインを上回ることを実証すること。

提案手法

  • 情報理論的MPCとエントロピー正則化RLの間の理論的関係を確立し、ポリシー最適化の統一フレームワークを可能にする。
  • バイアスのあるモデルを用いたMPCによりロールアウトを生成し、Q関数のターゲットとして利用することで、実世界の相互作用からの安定的かつ効率的な学習を実現する。
  • エントロピー正則化を用いることで、探索を促進し、学習中の早期収束を防ぐ。
  • 実システムのロールアウトを用いてQ関数を学習させることで、真の動的特性に適応し、モデルバイアスを低減する。
  • 学習済みQ関数が持つグローバルな情報を活用することで、MPCの計画ホライズンを短縮可能にし、計算効率を向上させる。
  • ターゲットネットワークを避けることで、トレーニングの簡素化と安定性の向上を実現する。

実験結果

リサーチクエスチョン

  • RQ1実世界のロールアウトから学習したQ関数は、MPCベース制御におけるモデルバイアスを克服できるか?
  • RQ2MPCとエントロピー正則化Q学習を組み合わせることで、モデルフリー強化学習に比べてサンプル効率が向上するか?
  • RQ3スパースな報酬と不完全なモデルがあるタスクにおいて、MPQはMPCとソフトQ学習を上回る性能を発揮できるか?
  • RQ4真のシステムパラメータが分かっているシミュレーションから実世界への転送において、MPQはドメインランダマイゼーションと比べてどのように差をつけるか?
  • RQ5性能を損なわせることなく、MPQはMPCの計画ホライズンを効果的に短縮できるか?

主な発見

  • MPQは短いホライズン(H=10)を用いるが、長いホライズン(H=64)を用いたMPPIを上回り、FetchPushBlockおよびFrankaDrawerOpenの両タスクで優れた性能を示した。特に後者では、5倍以上の高い成功率(5×以上)を達成した。
  • BallInCupSparseタスクでは、MPQ(H=4、実世界ロールアウト)が85%の成功率を達成したのに対し、DRベースの学習では41%にとどまった。
  • FrankaDrawerOpenタスクでは、MPQ(実世界ロールアウト)が53%の成功率を達成したが、DRベースラインはたった17%にとどまった。
  • MPQは実システムとの相互作用を数分間行うだけで安定したポリシーに収束したが、ソフトQ学習は同じタスクで一貫した収束を示さなかった。
  • MPQ(H=10)は、真の動的特性とH=64を用いたMPPIを上回る性能を示し、Q関数が持つグローバル情報の恩恵を実証した。
  • Q関数が長期間の効果を一般化できることにより、MPQはホライズンの短縮が可能となり、計算コストの削減が実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。