Skip to main content
QUICK REVIEW

[論文レビュー] Skill-based Model-based Reinforcement Learning

Lucy Xiaoyang Shi, Joseph J. Lim|arXiv (Cornell University)|Jul 15, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本論文は、スキル空間における正確な長期予測と計画を可能にするスキルダイナミクスモデルを学習する、スキルベースのモデルベース強化学習フレームワークSkiMoを提案する。従来のモデルベースおよびスキルベースRL手法と比較して、長期的で報酬がスパarsなナビゲーションおよび操作タスクにおけるサンプル効率と性能が顕著に向上する。

ABSTRACT

Model-based reinforcement learning (RL) is a sample-efficient way of learning complex behaviors by leveraging a learned single-step dynamics model to plan actions in imagination. However, planning every action for long-horizon tasks is not practical, akin to a human planning out every muscle movement. Instead, humans efficiently plan with high-level skills to solve complex tasks. From this intuition, we propose a Skill-based Model-based RL framework (SkiMo) that enables planning in the skill space using a skill dynamics model, which directly predicts the skill outcomes, rather than predicting all small details in the intermediate states, step by step. For accurate and efficient long-term planning, we jointly learn the skill dynamics model and a skill repertoire from prior experience. We then harness the learned skill dynamics model to accurately simulate and plan over long horizons in the skill space, which enables efficient downstream learning of long-horizon, sparse reward tasks. Experimental results in navigation and manipulation domains show that SkiMo extends the temporal horizon of model-based approaches and improves the sample efficiency for both model-based RL and skill-based RL. Code and videos are available at https://clvrai.com/skimo

研究の動機と目的

  • 長期的タスクにおけるモデルベースRLの限界、特に誤差の蓄積と高い計算コストに対処すること。
  • 通常は数百万〜数十億回の環境インタラクションを要するスキルベースRLのサンプル効率を向上させること。
  • 中間ステップを要約するスキルレベルのダイナミクスモデルを学習することで、正確な長期予測と計画を可能にすること。
  • オフラインデータからスキルレパートリーとスキルダイナミクスモデルを同時に学習し、計画の信頼性と下流のポリシー学習を向上させること。

提案手法

  • 大規模なオフラインデータセットを用いて、予測可能で実行可能なスキル埋め込み空間を形成するため、スキルダイナミクスモデルとスキルレパートリーを同時に学習する。
  • 示された軌道から、分離可能で解釈可能なスキル埋め込みを学ぶために変分自己オートエンコーダ(VAE)を用いる。
  • 段階的ダイナミクス予測を、スキル実行後の結果状態を直接予測するものに置き換えることで、誤差の蓄積を低減する。
  • 学習済みのスキルダイナミクスモデルを用いて、CEM や MPPI などの計画アルゴリズムにおける長期的ロールアウトを実現し、ハイレベルポリシー学習をガイドする。
  • SAC(Soft Actor-Critic)を用いて、スキルダイナミクスモデルが予測する未来の結果に基づいてスキルを選択するハイレベルタスクポリシーを学習する。
  • カリキュラム学習とカリキュラムベースの探索を用いて、下流タスクの学習中にサンプル効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1フラットな段階的ダイナミクスモデルと比較して、スキルレベルのダイナミクスモデルを学習することで、長期予測誤差を低減できるか?
  • RQ2スキルダイナミクスモデルを用いてスキル空間で計画することで、長期的で報酬がスパarsなタスクにおけるサンプル効率が向上するか?
  • RQ3スキルとスキルダイナミクスモデルの共同学習が、下流ポリシーの性能と計画の正確性に与える影響は何か?
  • RQ4スキルダイナミクスモデルは、標準のモデルベースベースラインと比較して、より信頼性の高い長期的軌道予測を可能にするか?

主な発見

  • SkiMoは、報酬がスパarsな長期的ナビゲーションおよび操作タスクにおいて、最先端のモデルベースおよびスキルベースRL手法を上回る性能を発揮する。
  • スキルダイナミクスモデルにより、長期的予測における誤差蓄積が低減され、真値からのずれが最小限に抑えられる500ステップの正確な軌道シミュレーションが可能になる。
  • スキルダイナミクスモデルとスキルレパートリーの共同学習は、特にMazeやCALVINのような複雑な環境において、より速く安定した学習を実現する。
  • CEM計画にスキルダイナミクスモデルを組み込むことで、KitchenおよびCALVINタスクにおけるサンプル効率と最終的な性能が顕著に向上する。
  • SkiMoは、LSP や DADS などのベースライン手法と比較して、特に長距離推論を要する環境において、より速い学習を達成する。
  • アブレーションスタディの結果、スキルダイナミクスモデルが長期的タスク性能において不可欠であることが確認され、単一ステップのダイナミクスモデルに置き換えると、計画と学習が著しく劣化する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。