Skip to main content
QUICK REVIEW

[論文レビュー] Neural Network Dynamics for Model-Based Deep Reinforcement Learning with Model-Free Fine-Tuning

Anusha Nagabandi, Gregory Kahn|arXiv (Cornell University)|Aug 8, 2017
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

この論文は、わずか70万ステップのランダム行動データのみを用いて訓練されたニューラルネットワークダイナミクスモデルを活用する、ハイブリッドなモデルベースとモデルフリーの強化学習アプローチを提案する。モデルフリーの学習をモデルベースのポリシーで初期化することで、MuJoCoベンチマークのスイマー、チーター、ホッパー、アンチなどの歩行タスクにおいて、3〜5倍のサンプル効率の向上を達成し、最小限のデータでリアルタイムの軌道追従が可能になる。

ABSTRACT

Model-free deep reinforcement learning algorithms have been shown to be capable of learning a wide range of robotic skills, but typically require a very large number of samples to achieve good performance. Model-based algorithms, in principle, can provide for much more efficient learning, but have proven difficult to extend to expressive, high-capacity models such as deep neural networks. In this work, we demonstrate that medium-sized neural network models can in fact be combined with model predictive control (MPC) to achieve excellent sample complexity in a model-based reinforcement learning algorithm, producing stable and plausible gaits to accomplish various complex locomotion tasks. We also propose using deep neural network dynamics models to initialize a model-free learner, in order to combine the sample efficiency of model-based approaches with the high task-specific performance of model-free methods. We empirically demonstrate on MuJoCo locomotion tasks that our pure model-based approach trained on just random action data can follow arbitrary trajectories with excellent sample efficiency, and that our hybrid algorithm can accelerate model-free learning on high-speed benchmark tasks, achieving sample efficiency gains of 3-5x on swimmer, cheetah, hopper, and ant agents. Videos can be found at https://sites.google.com/view/mbmf

研究の動機と目的

  • ロボット制御における純粋なモデルフリー深層強化学習の高いサンプル複雑性に対処すること。
  • ニューラルネットワークダイナミクスモデルを用いて、複雑で高次元の歩行タスクにおいてサンプル効率の良い学習を可能にすること。
  • モデルベース学習のサンプル効率とモデルフリー手法の高い漸近的性能を組み合わせること。
  • 最小限のオフポリシー・データでのダイナミクスモデルの訓練によって、実世界への展開可能性を示すこと。
  • シミュレーションおよび実世界のシナリオにおいて、ロバストな歩行ゲイツを学習する実用的でデータ効率の良い手法を提供すること。

提案手法

  • オフポリシーで収集されたランダム行動ロールアウトのみを用いて、環境ダイナミクスをモデル化するための多層フィードフォワードニューラルネットワークを訓練する。
  • 推論時に、学習済みのダイナミクスモデルに基づいて制御入力を生成するために、ランダムシューティングを用いたモデル予測制御(MPC)を用いる。
  • MPCコントローラーが生成したロールアウトを用いて教師付き事前学習を行うことで、モデルベースポリシーをモデルフリーのポリシーの初期化に用いる。
  • 初期化されたポリシーは、その後、モデルフリー強化学習(例:ポリシー勾配)を用いてファインチューニングされ、最終的な性能を向上させる。
  • 訓練中にデータ集約技術を適用することで、ダイナミクスモデルの汎化性能と安定性を向上させる。
  • 本手法は、スイマー、ハーフチーター、ホッパー、アンチを含むMuJoCoの歩行タスクベンチマークで評価される。

実験結果

リサーチクエスチョン

  • RQ1ランダムでオフポリシーのデータのみを用いて訓練されたニューラルネットワークダイナミクスモデルは、複雑な歩行タスクにおける効果的なモデルベース制御を可能にするか?
  • RQ2提案されたモデルベースアプローチのサンプル効率は、高次元制御タスクにおける純粋なモデルフリー手法と比較してどの程度か?
  • RQ3モデルベースポリシーがモデルフリーの学習者を効果的に初期化することで、収束を加速させつつも高い最終的性能を維持できるか?
  • RQ4データ集約やMPCの定式化といった、設計選択肢の中で、ニューラルネットワークダイナミクスモデルの性能に最も大きな影響を与えるものは何か?
  • RQ5再トレーニングなしで、1つのダイナミクスモデルを複数の軌道追従タスクに再利用できる範囲はどの程度か?

主な発見

  • モデルベースアプローチ単体で、7e5ステップのランダム行動データ(4時間未塔)を用いて、多様なタスクで効果的なゲイツ学習が達成された。
  • ハイブリッドMb-Mf手法は、MuJoCoベンチマークのスイマー、チーター、ホッパー、アンチエージェントにおいて、純粋なモデルフリー学習と比較して3〜5倍のサンプル効率の向上を達成した。
  • アンチエージェントでは、純粋なモデルフリー手法が要請するデータの14%のデータ量で安定した歩行ゲイツに到達した。
  • ランダムデータで訓練されたダイナミクスモデルは、再トレーニングなしでテスト時に任意の軌道追従タスクに一般化できた。
  • モデルベースコントローラー単体でも、安定したゲイツを素早く学習できたが、モデルバイアスのため性能が頭打ちに陥り、モデルフリー手法によるファインチューニングでこれを克服した。
  • 本手法は、低データ要件とオフポリシー・ロールアウトからの学習が可能であるため、実世界のロボット展開の実用的可行性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。