Skip to main content
QUICK REVIEW

[論文レビュー] Demonstration-Guided Reinforcement Learning with Learned Skills

Karl Pertsch, Youngwoon Lee|arXiv (Cornell University)|Jul 21, 2021
Reinforcement Learning in Robotics参考文献 44被引用数 9
ひとこと要約

本稿では、幅広いオフラインで収集されたタスクに依存しないデータセットから学習した再利用可能なスキルを活用して、新しいタスクの学習を加速する、デモ誘導型強化学習手法SkiLDを提案する。本手法は、原始的アクションの逐次的模倣ではなく、提示されたスキルによってポリシー学習を誘導することで、長時間にわたるナビゲーションおよびロボット操作タスクにおいて、従来手法に比べて著しく高速かつサンプル効率の高い学習を達成する。

ABSTRACT

Demonstration-guided reinforcement learning (RL) is a promising approach for learning complex behaviors by leveraging both reward feedback and a set of target task demonstrations. Prior approaches for demonstration-guided RL treat every new task as an independent learning problem and attempt to follow the provided demonstrations step-by-step, akin to a human trying to imitate a completely unseen behavior by following the demonstrator's exact muscle movements. Naturally, such learning will be slow, but often new behaviors are not completely unseen: they share subtasks with behaviors we have previously learned. In this work, we aim to exploit this shared subtask structure to increase the efficiency of demonstration-guided RL. We first learn a set of reusable skills from large offline datasets of prior experience collected across many tasks. We then propose Skill-based Learning with Demonstrations (SkiLD), an algorithm for demonstration-guided RL that efficiently leverages the provided demonstrations by following the demonstrated skills instead of the primitive actions, resulting in substantial performance improvements over prior demonstration-guided RL approaches. We validate the effectiveness of our approach on long-horizon maze navigation and complex robot manipulation tasks.

研究の動機と目的

  • 各新しいタスクを独立して扱い、原始的アクションを段階的に模倣する従来のデモ誘導型RL手法の非効率性を解消する。
  • 多様なタスクにわたって収集された大規模なタスクに依存しないオフラインデータセットを活用し、再利用可能で頑健な短時間スコープのスキルを抽出する。
  • 新しいタスクの学習を、再びから学習するのではなく、事前に学習したスキルを連結するスキルベースのポリシーを用いることで、デモ誘導型RLのサンプル効率を向上させる。
  • 限られたデモで新しいタスクに効果的に転移できるように、スキルの事前分布とタスク関連の行動分布を一致させる。
  • アシスト学習とスキルベースの強化学習のギャップを埋めるために、オフラインスキル学習とタスク固有のデモを組み合わせる。

提案手法

  • 多様なタスクの経験を収集した大規模なオフラインデータセットから、スキル発見アルゴリズム(例:SPiRLに基づく手法)を用いて再利用可能なスキルの集合を学習する。
  • オフラインデータからスキルの事後分布を構築し、タスク関連のスキルに向かって探索とポリシー最適化を誘導する。
  • 識別子ベースの報酬ボーナスと学習済みのスキル事後分布事前分布を組み合わせた強化学習の目的関数を設計する。
  • デモを原始的アクションの模倣ではなく、高レベルのスキルの連結を誘導するスキルレベルのポリシーを通じて活用する。
  • 環境報酬、GAIL風の識別子ボーナス、スキル事後分布事前分布の組み合わせを用いてポリシーを最適化し、学習の安定化を図る。
  • デモされた状態の模倣を促進すると同時に、スキルレパートリーを活用して効率的な探索を実現するハイブリッド目的関数を用いてポリシーをファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1タスクに依存しないオフラインデータセットからの事前経験は、新しいタスクにおけるデモ誘導型RLのサンプル効率を顕著に向上させ得るか?
  • RQ2複雑で長時間にわたるタスクにおいて、スキルベースの模倣は原始的アクションの模倣に比べて、頑健性と学習速度の点で優れているか?
  • RQ3特にデータとタスクの整合性の観点から、デモとオフラインスキル事前分布を組み合わせることで最大の利点が得られる状況はどのようなものか?
  • RQ4オフラインデータセットがターゲットタスクと整合性が取れていない場合でも、学習済みのスキル事後分布がポリシー学習を効果的に誘導できるか?
  • RQ5報酬なしの純粋な模倣設定において、デモとスキル事前分布を統合したアプローチは、純粋な模倣ベースや純粋なRLベースの手法に比べて収束性と最終パフォーマンスで優れているか?

主な発見

  • SkiLDは、長時間にわたる迷路ナビゲーションおよびロボット操作タスクにおいて、BC+RLおよびSPiRLに比べて著しく高速な学習と高い最終パフォーマンスを達成する。
  • 本手法は、顕著に少ないデモで効果的なポリシーを学習でき、事前スキル知識を活用することで、低ショットデモデータに対しても頑健であることを示す。
  • アブレーションスタディの結果、識別子報酬ボーナスを除去すると収束が遅くなる一方、スキル事前分布を学習済み事後分布に置き換えると、分布の不整合により失敗が生じる。
  • オフラインデータセットがターゲットタスクと整合性が取れていない場合、SkiLDはデモを用いてスキル事前分布を補正し、タスク関連の行動にポリシーを誘導することで、SPiRLを上回るパフォーマンスを発揮する。
  • オフラインデータにすでにタスク関連のスキルが含まれていない状況で、本手法は特に効果的であり、低データかつ高可変性の環境における価値を示している。
  • 環境報酬なしの純粋な模倣設定においても、SkiLDは依然として効果的に一般化できることから、スキルベースのポリシー学習フレームワークの頑健性が裏付けられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。