Skip to main content
QUICK REVIEW

[論文レビュー] A Meta-MDP Approach to Exploration for Lifelong Reinforcement Learning

Francisco Moreno, Philip S. Thomas|arXiv (Cornell University)|Feb 3, 2019
Reinforcement Learning in Robotics参考文献 29被引用数 11
ひとこと要約

本論文は、関連するタスク間で蓄積された過去の経験を活用することで、継続的強化学習エージェントが最適な探索方策を学習できるメタMDPフレームワークを提案する。探索方策探索をメタMDPとしてモデル化することで、エージェントは新しいタスクで学習を加速するような行動選択を学習する。Hopperのような連続的制御タスクでは、MAMLと比較して最大4倍の報酬を達成した。

ABSTRACT

In this paper we consider the problem of how a reinforcement learning agent that is tasked with solving a sequence of reinforcement learning problems (a sequence of Markov decision processes) can use knowledge acquired early in its lifetime to improve its ability to solve new problems. We argue that previous experience with similar problems can provide an agent with information about how it should explore when facing a new but related problem. We show that the search for an optimal exploration strategy can be formulated as a reinforcement learning problem itself and demonstrate that such strategy can leverage patterns found in the structure of related problems. We conclude with experiments that show the benefits of optimizing an exploration strategy using our proposed approach.

研究の動機と目的

  • 継続的強化学習における非効率な探索の課題に取り組むこと。具体的には、エージェントが新しいタスクに対して学習を再びゼロから開始するという問題を解決すること。
  • 最適な探索方策の探索をメタMDP問題として形式化することで、関連するタスク間で探索方策を転移可能にする。
  • 過去のタスク経験を活用して、新規タスクで学習を加速する汎用的探索方策を学習可能であることを示すこと。
  • メタRLを用いて探索方策を学習することで、MAML やランダム探索といった標準的手法と比較して、サンプル効率が向上することを示すこと。

提案手法

  • 本論文は、最適な探索方策を求める問題を、各エピソードがタスク解決用RLエージェントの人生に対応するメタMDPとしてモデル化する。
  • メタエージェントは、以前に遭遇したMDPの系列における探索の結果を観測することで、探索方策を学習する。
  • 探索方策は、メタMDP上で強化学習を用いて最適化され、新しいタスクにおける累積報酬の最大化を目的とする。
  • 探索(学習済み方策に従って制御される)と活用(タスク固有の方策に従って制御される)を明確に区別することで、エージェントが効率的な探索に集中できるようにする。
  • メタMDPはPPO や REINFORCE といったアルゴリズムを用いて訓練され、内因的報酬と過去の経験によって探索行動が調整される。
  • フレームワークは、ポールバランス、アニメート、Hopper、Ant といった離散的および連続的制御タスクで評価され、安定性とパフォーマンスを最適化するためのハイパーパrameterチューニングが実施された。

実験結果

リサーチクエスチョン

  • RQ1関連するMDPに対する過去の経験を活用することで、継続的RLにおける新規タスクのより効果的な探索方策を学習できるか?
  • RQ2メタRLを用いて探索方策を学習することは、ε-greedy やランダム行動選択といった標準的探索戦略と比較して、サンプル効率にどの程度優れているか?
  • RQ3MAML などの手法と比較して、メタ学習された探索方策は新規タスクでの学習をどの程度加速できるか?
  • RQ4メタMDPアプローチは、離散的および連続的制御環境を含むさまざまなタスククラスに一般化可能か?
  • RQ5新しいタスクのダイナミクスや状態・行動空間の構造が異なる場合でも、学習済み探索方策は効果的に転送可能か?

主な発見

  • アニメートタスククラスでは、REINFORCEを用いたアドバイザーにより、MAMLと比較して性能が約50%向上し、平均報酬が-779.62から-387.27に低下した。
  • 連続的制御タスクでは、HopperタスクでPPOを用いたアドバイザーにより報酬が12倍に向上(164.43 対 13.82)し、高いサンプル効率の向上が確認された。
  • ポールバランス(連続的)タスクでは、PPOを用いたアドバイザーが平均報酬438.13を達成し、PPO単体の29.95と比較して約15倍の高い性能を示し、学習の大幅な加速が確認された。
  • Antタスクでは、MAMLがより高い平均報酬を達成したが、アドバイザー手法は分散が低く、PPOベースラインを上回る性能を示し、より安定した学習が実現した。
  • 探索方策単体ではタスクの完了が不十分であることが確認され、これは一般化された活用方策ではないことを示しているが、タスク固有の方策と組み合わせることで学習が著しく向上した。
  • すべてのタスクにおいて、500エピソード以内にベースライン手法よりも一貫してパフォーマンスが向上し、収束が速く、サンプル効率が優れていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。