Skip to main content
QUICK REVIEW

[論文レビュー] Skill-based Meta-Reinforcement Learning

Taewook Nam, Shao-Hua Sun|arXiv (Cornell University)|Apr 25, 2022
Domain Adaptation and Few-Shot Learning被引用数 11
ひとこと要約

この論文では、アノテーションのないオフラインデータセットから再利用可能なスキルとスキル事前分布を抽出し、高レベルのポリシーをスキル事前分布で正則化することで、未学習の長時間スパン・スパarsely-rewardedタスクへの高速適応を可能にするスキルベースのメタ強化学習手法SiMPLを提案する。この手法により、ナビゲーションおよび操作タスクにおいて、従来の深層強化学習、メタ強化学習、マルチタスク強化学習手法と比較して、サンプル効率が桁違いに向上する。

ABSTRACT

While deep reinforcement learning methods have shown impressive results in robot learning, their sample inefficiency makes the learning of complex, long-horizon behaviors with real robot systems infeasible. To mitigate this issue, meta-reinforcement learning methods aim to enable fast learning on novel tasks by learning how to learn. Yet, the application has been limited to short-horizon tasks with dense rewards. To enable learning long-horizon behaviors, recent works have explored leveraging prior experience in the form of offline datasets without reward or task annotations. While these approaches yield improved sample efficiency, millions of interactions with environments are still required to solve complex tasks. In this work, we devise a method that enables meta-learning on long-horizon, sparse-reward tasks, allowing us to solve unseen target tasks with orders of magnitude fewer environment interactions. Our core idea is to leverage prior experience extracted from offline datasets during meta-learning. Specifically, we propose to (1) extract reusable skills and a skill prior from offline datasets, (2) meta-train a high-level policy that learns to efficiently compose learned skills into long-horizon behaviors, and (3) rapidly adapt the meta-trained policy to solve an unseen target task. Experimental results on continuous control tasks in navigation and manipulation demonstrate that the proposed method can efficiently solve long-horizon novel target tasks by combining the strengths of meta-learning and the usage of offline datasets, while prior approaches in RL, meta-RL, and multi-task RL require substantially more environment interactions to solve the tasks.

研究の動機と目的

  • 現実世界のロボット学習における深層強化学習のサンプル非効率性、特に長時間スパン・スパarsely-rewardedタスクに対する課題を解決すること。
  • アノテーションのないオフラインデータセットからの事前経験を統合することで、短時間スパン・密度報酬タスクにとどまらないメタ強化学習を拡張すること。
  • オフラインデータから再利用可能なスキルとスキル事前分布を学習することで、未学習のターゲットタスクへの高速適応を可能にすること。
  • メタ学習と階層的スキル構成を組み合わせることで、長時間スパン制御におけるサンプル効率を向上させること。
  • メタ学習が、タスクに依存しないオフラインデータと効果的に組み合わせられ、複雑で報酬がスパarselyな環境において有効に機能することを示すこと。

提案手法

  • 報酬やタスクのアノテーションがないオフラインデータセットに含まれる軌道から、再利用可能なスキルとスキル事前分布を抽出する。
  • スキル事前分布を正則化子として用いて、高レベルポリシーをメタトレーニングし、学習済みスキルを組み合わせて長時間スパンの行動を生成する。
  • 高レベルポリシーが低レベルスキルを選択・順序付けする階層的強化学習フレームワークを採用する。
  • 高レベルポリシーの汎化性能を向上させるために、ターゲットタスクと類似または多様なメタトレーニングタスクの分布を用いてトレーニングする。
  • オフラインデータをスキル発見だけでなく、メタトレーニングにおける探索の削減に寄与する事前知識の供給源としても活用する。
  • カリキュラム学習とタスク分布バイアス化を適用し、メタトレーニングタスクの類似性が性能に与える影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1アノテーションのないオフラインデータセットのみを用いて、長時間スパン・スパarsely-rewardedタスクにメタ強化学習を効果的に適用できるか?
  • RQ2メタトレーニングタスクの分布の質が、メタ学習済みポリシーのサンプル効率にどのように影響するか?
  • RQ3スキルベースのメタ強化学習は、従来の深層強化学習およびメタ強化学習手法と比較して、環境との相互作用を著しく削減できるか?
  • RQ4オフラインデータから学習したスキル事前分布は、メタトレーニングにおける汎化性とサンプル効率を向上させるか?
  • RQ5メタトレーニングタスクとターゲットタスクの分布の整合性が、未学習タスクの性能にどのように影響するか?

主な発見

  • SiMPLは、従来手法と比較して著しく高いサンプル効率を達成し、未学習の長時間スパンタスクを、環境との相互作用を桁違いに減らして解消可能である。
  • メタトレーニングタスクが10個または20個の少数でも、SiMPLは最良のベースライン(SPiRL)を上回り、メタトレーニングタスクのスパarsely分布に対しても頑健であることを示した。
  • ターゲットタスクと類似したタスク分布(例:迷路の上位25%)でメタトレーニングした場合、SiMPLはターゲットタスクで優れた性能を発揮した。
  • メタトレーニングタスクとターゲットタスクの分布が不一致の場合、性能が低下し、タスク分布の整合性の重要性が確認された。
  • 迷路ナビゲーションおよびキッチン操作タスクの両方において、SiMPLはSPiRL、MTRLその他のベースラインを上回ったが、特に報酬がスパarselyな状況で顕著な優位性を示した。
  • オフラインデータから学習したスキル事前分布は、高レベルポリシーの正則化に効果的に機能し、メタテスト時の探索効率化と迅速な適応を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。