Skip to main content
QUICK REVIEW

[論文レビュー] Residual Skill Policies: Learning an Adaptable Skill-based Action Space for Reinforcement Learning for Robotics

Krishan Rana, Ming Xu|arXiv (Cornell University)|Nov 4, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本論文では、状態に応じた生成モデルを用いて関連するスキルに向けた探索を誘導し、低レベルの残差ポリシーを導入してタスクの変化に適応する強化学習フレームワーク、Residual Skill Policies (ReSkill) を提案する。この手法により、事前学習済みのスキル空間とは異なる4つの未学習な操作タスクにおいて、収束が速く、最終的な性能も向上する。

ABSTRACT

Skill-based reinforcement learning (RL) has emerged as a promising strategy to leverage prior knowledge for accelerated robot learning. Skills are typically extracted from expert demonstrations and are embedded into a latent space from which they can be sampled as actions by a high-level RL agent. However, this skill space is expansive, and not all skills are relevant for a given robot state, making exploration difficult. Furthermore, the downstream RL agent is limited to learning structurally similar tasks to those used to construct the skill space. We firstly propose accelerating exploration in the skill space using state-conditioned generative models to directly bias the high-level agent towards only sampling skills relevant to a given state based on prior experience. Next, we propose a low-level residual policy for fine-grained skill adaptation enabling downstream RL agents to adapt to unseen task variations. Finally, we validate our approach across four challenging manipulation tasks that differ from those used to build the skill space, demonstrating our ability to learn across task variations while significantly accelerating exploration, outperforming prior works. Code and videos are available on our project website: https://krishanrana.github.io/reskill.

研究の動機と目的

  • 大規模で汎用的なスキル空間における非効率な探索を解消するため、現在の状態に応じたスキル事前分布を学習し、関連するスキルに偏ったサンプリングを可能にする。
  • 下流の強化学習エージェントが未学習なタスク変化に適応できるように、微細な制御を可能にする低レベルの残差ポリシーを導入する。
  • エキスパートのデモンストレーションを網羅的に用いるのを減らすために、古典的コントローラーをスキルデータの供給源として活用する。
  • 元のスキル学習データのタスク分布に制限されないまま、スキルベースの強化学習におけるサンプル効率と最終的性能を向上させる。
  • スキル空間の構築時に未確認の多様な操作タスクへの一般化を実証する。

提案手法

  • 正規化フローを用いた状態に応じたスキル事前分布を学習し、与えられたロボット状態に対して関連するスキルの多モード的条件付き密度をモデル化することで、状態に関連するスキルを直接サンプリング可能にする。
  • エキスパートデモンストレーションを連続的潜在スキル空間に埋め込むための変分オートエンコーダ(VAE)を用いてスキル事前分布を学習し、その後、複雑な多モード分布をモデル化するためのフロー変換を適用する。
  • 高レベルのスキル行動に対する補正を予測する低レベルの残差ポリシーを導入し、物体の位置、摩擦、障害物などの環境変化に微細に適応可能にする。
  • 高レベルの強化学習エージェントは、状態に応じたスキル事前分布からサンプリングされた行動を用いてスキル空間で動作する一方、残差ポリシーにより1ステップの行動にアクセス可能となり、精密制御が可能になる。
  • フレームワークはエンドツーエンドで訓練され、高レベルポリシーは強化学習により最適化されるが、下流の訓練中はスキル事前分布と残差ポリシーは固定されており、ポリシーの安定性を維持する。
  • 2段階の訓練プロセスを採用する:まずエキスパートデモンストレーション上でスキル埋め込みと事前分布モジュールを事前学習し、その後、下流タスクで高レベルポリシーをファインチューニングする。

実験結果

リサーチクエスチョン

  • RQ1状態に応じた生成モデルは、大規模かつ多モードのスキル空間において、現在の状態に適したスキルのみをサンプリングすることで、効果的に探索を誘導できるか?
  • RQ2低レベルの残差ポリシーは、物体の位置、摩擦、障害物などの未学習なタスク変化に、どの程度スキルを適応可能にできるか?
  • RQ3スキル事前分布と残差ポリシーの組み合わせは、標準的なスキルベースの強化学習と比較して、サンプル効率と最終的性能をどのように向上させるか?
  • RQ4限定的なタスクセットで事前学習されたスキル空間は、新たなエキスパートデモンストレーションを必要とせずに、より広範な範囲の操作タスクに一般化可能か?
  • RQ5スキル事前分布と残差ポリシーの両者が、総合的な学習速度と最終的性能に果たす相対的寄与度はどの程度か?

主な発見

  • 再配置タスクと複雑なフックタスクにおいて、アブレーションスタディで示されるように、ReSkillはベースライン手法と比較して学習を著しく加速する。
  • ReSkill (No Skill Prior) の変種は、複雑な再配置タスクで効果的に学習に失敗しており、状態に応じたスキル事前分布が初期段階での関連スキルの探索を可能にする上で極めて重要な役割を果たしていることを示している。
  • ReSkill (No Residual) の変種は、完全なReSkillモデルと比較して最終的な性能が低く抑えられ、残差適応が困難なタスクで高い漸近的性能を達成するために不可欠であることを確認している。
  • テーブルクリーニングと複雑なフックタスクを含む4つの操作タスクすべてにおいて、ReSkillはSPiRLやその他のアトミックアクションベースの手法と比較して、サンプル効率と最終リターンの両面で優れている。
  • 少量の古典的コントローラーを再利用することで、事前に学習されたスキル分布を超えた多様な未確認タスクを効果的に解決可能であることを示しており、強い一般化性能を示している。
  • アブレーションスタディにより、スキル事前分布が関連するスキルの直接的かつ標的的なサンプリングを可能にし、KL正則化を施した手法(例:SPiRL)が要する「バーンイン」フェーズを回避できることを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。