Skip to main content
QUICK REVIEW

[論文レビュー] Sample-Efficient Learning of Nonprehensile Manipulation Policies via Physics-Based Informed State Distributions

Lerrel Pinto, Aditya Mandalika|arXiv (Cornell University)|Oct 24, 2018
Reinforcement Learning in Robotics参考文献 9被引用数 10
ひとこと要約

本稿では、リハーサル計画から得られる物理的インフォームドな状態分布を用いて、訓練中に環境をリセットする、非捕捉的操作におけるサンプル効率の良い強化学習手法LeaPERを提案する。計画された軌道を事前知識として活用することで、LeaPERは学習を最大5倍に加速し、エキスパートのデモンストレーションや密集型リワード形状に依存せずに、オープンループ制御や単純なフィードバックポリシーに比べて著しく高いタスク成功確率を達成する。これは、簡略化された物理モデルでさえも有効であることを示している。

ABSTRACT

This paper proposes a sample-efficient yet simple approach to learning closed-loop policies for nonprehensile manipulation. Although reinforcement learning (RL) can learn closed-loop policies without requiring access to underlying physics models, it suffers from poor sample complexity on challenging tasks. To overcome this problem, we leverage rearrangement planning to provide an informative physics-based prior on the environment's optimal state-visitation distribution. Specifically, we present a new technique, Learning with Planned Episodic Resets (LeaPER), that resets the environment's state to one informed by the prior during the learning phase. We experimentally show that LeaPER significantly outperforms traditional RL approaches by a factor of up to 5X on simulated rearrangement. Further, we relax dynamics from quasi-static to welded contacts to illustrate that LeaPER is robust to the use of simpler physics models. Finally, LeaPER's closed-loop policies significantly improve task success rates relative to both open-loop controls with a planned path or simple feedback controllers that track open-loop trajectories. We demonstrate the performance and behavior of LeaPER on a physical 7-DOF manipulator in https://youtu.be/feS-zFq6J1c.

研究の動機と目的

  • 長時間にわたる、複数のオブジェクトを含むリハーサルタスクにおける強化学習の高いサンプル複雑性に対処すること。
  • エキスパートデモンストレーションや密集型リワード形状に依存せずに、サンプル効率を向上させること。
  • 確率的ダイナミクスや不完全な物理モデル下でも、ロバストなポリシー学習を可能とすること。
  • シミュレーションで訓練されたポリシーを実世界のロボットシステムに転送できること。
  • 簡略化された物理モデルですら、サンプル効率の良い強化学習のための有効な事前知識を提供できることを示すこと。

提案手法

  • LeaPERは、準静的または簡略化された物理モデルを用いたリハーサルプランナ(PC-RRT)を用い、オープンループ軌道を生成する。
  • これらの軌道に沿って訪問された状態が、強化学習訓練におけるエピソード的リセットの事前知識として使用される。
  • 訓練中、環境は計画された軌道に沿った状態からサンプリングされた状態にリセットされ、探索効率が向上する。
  • 本手法は任意のエピソード的強化学習アルゴリズムと互換性があり、実験ではHERをベースアルゴリズムとして使用している。
  • 計画を高速化するために、接触モデルを簡略化(例:溶接接触)し、依然として有用な事前知識を提供する。
  • シミュレーションから実世界への転送は、状態推定(OptiTrack)とダイナミクスドメインランダマイゼーションにより実現される。

実験結果

リサーチクエスチョン

  • RQ1計画から得られる物理的インフォームドな状態分布は、非捕捉的操作におけるサンプル複雑性を顕著に低減できるか?
  • RQ2計画に簡略化された物理モデルを使用しても、強化学習に有効な事前知識が得られるか?
  • RQ3LeaPERは、確率的ダイナミクス下でも、オープンループ制御を上回るロバストな閉ループポリシーを学習できるか?
  • RQ4シミュレーションから実世界のロボットシステムへのポリシー転送において、LeaPERはどの程度の性能を示すか?
  • RQ5プランナの物理モデルが現実のダイナミクスから逸脱している場合でも、本手法は有効であるか?

主な発見

  • LeaPERは、シミュレーテッドなリハーサルタスクにおいて、標準的なRLベースラインと比較して、最大5倍のサンプル複雑性低減を達成した。
  • オープンループ制御や計画された軌道を追跡するフィードバックコントローラーと比較して、著しく高いタスク成功確率を達成した。
  • 溶接接触モデル(非常に簡略化された物理近似)を用いても、事前知識なしの標準的なRLや標準RLを上回る性能を示した。
  • LeaPERを用いて学習された閉ループポリシーは、確率的ダイナミクスに強く、名目軌道からの逸脱を是正できる。
  • OptiTrackによる状態推定とドメインランダマイゼーションを用いて、物理的な7自由度マニピュレータにポリシーを成功裏に転送した。
  • プランナが近似された物理モデルを使用している場合でもLeaPERが有効であることが示され、計画された軌道が事前知識としての価値を持つことが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。