Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Generalize Across Long-Horizon Tasks from Human Demonstrations

Ajay Mandlekar, Danfei Xu|arXiv (Cornell University)|Mar 13, 2020
Reinforcement Learning in Robotics参考文献 36被引用数 17
ひとこと要約

本稿では、人間のデモにおける重複する状態を活用することで、未学習の長時間スケールの操作タスクに一般化できる2段階のオフライン強化学習フレームワークであるGeneralization Through Imitation (GTI) を提案する。最初の段階で、軌道の交差を介して多様な行動を生成する確率的方策を学習し、2番目の段階でそのロールアウトをもとにゴール条件付き方策を微調整することで、実世界のロボット操作タスクにおいて、新しいスタート・ゴールの組み合わせで50%以上の成功確率を達成する。

ABSTRACT

Imitation learning is an effective and safe technique to train robot policies in the real world because it does not depend on an expensive random exploration process. However, due to the lack of exploration, learning policies that generalize beyond the demonstrated behaviors is still an open challenge. We present a novel imitation learning framework to enable robots to 1) learn complex real world manipulation tasks efficiently from a small number of human demonstrations, and 2) synthesize new behaviors not contained in the collected demonstrations. Our key insight is that multi-task domains often present a latent structure, where demonstrated trajectories for different tasks intersect at common regions of the state space. We present Generalization Through Imitation (GTI), a two-stage offline imitation learning algorithm that exploits this intersecting structure to train goal-directed policies that generalize to unseen start and goal state combinations. In the first stage of GTI, we train a stochastic policy that leverages trajectory intersections to have the capacity to compose behaviors from different demonstration trajectories together. In the second stage of GTI, we collect a small set of rollouts from the unconditioned stochastic policy of the first stage, and train a goal-directed agent to generalize to novel start and goal configurations. We validate GTI in both simulated domains and a challenging long-horizon robotic manipulation domain in the real world. Additional results and videos are available at https://sites.google.com/view/gti2020/ .

研究の動機と目的

  • 限られたエキスパートデモでの長時間スケールのロボット操作タスクにおける強化学習の一般化の課題に対処すること。
  • 探索が不足しているため、標準的なIL手法が示された行動を超えて一般化に失敗するという制限を克服すること。
  • 具体的には、共通の状態で交差する軌道を介して、現実のタスクに潜む潜在的な構造的パターン(特に、共通状態での軌道の交差)を活用し、構成的行動一般化を可能にすること。
  • 物理的ロボットへの実装を可能にするスケーラブルでデータ効率の良いフレームワークを構築すること。再トレーニングや人手によるタスク仕様のアノテーションを必要としない。
  • 確率的方策から自己生成されたロールアウトが、オリジナルのデモのみを用いた場合よりも、ゴール指向の政策学習のための強力な監督を提供できることを示すこと。

提案手法

  • ロボツルクインターフェースを用いた遠隔操作により、固有の交差構造を持つ長時間スケールのタスクに焦点を当てた人間のデモを収集する。
  • 最初の段階で、現在の状態を条件とした将来の観測の分布をモデル化するための条件付き変分オートエンコーダ(cVAE)を学習する。多様なロールアウトを促進するために、ガウス・ミックスチャネル・モデル(GMM)を事前分布として用いる。
  • 最初の段階で、cVAEの潜在変数を用いて、任意の状態から閉ループ型の視覚運動制御行動を生成する、ゴール条件付きの低レベル方策を学習する。
  • 最初の段階の無条件な確率的方策から得られるロールアウトを収集し、自己生成された軌道の多様なデータセットを構築する。
  • 2番目の段階で、自己生成されたロールアウトを用いて、ゴール条件付き行動クラッシング(GCBC)を用いてゴール指向の政策を微調整する。これにより、新しいスタートおよびゴールの設定への一般化が可能になる。
  • ロールアウト中にcVAEの事前分布を用いて多様な潜在変数をサンプリングし、軌道の交差を活用することで、新しいゴール状態の探索を促進する。

実験結果

リサーチクエスチョン

  • RQ1少数の人のデモから学習した方策は、長時間スケールの操作タスクにおいて、未学習のスタート・ゴール状態の組み合わせに一般化できるか?
  • RQ2状態空間における軌道の交差を活用することで、追加のデモやアノテーションなしに、効果的な構成的行動一般化が可能になるか?
  • RQ3確率的方策から自己生成されたロールアウトは、オリジナルのデモを直接模倣するのと比較して、ゴール指向の模倣学習のためのより良い監督を提供できるか?
  • RQ42段階のGTIフレームワークは、複雑で多段階的なタスクを含む実世界のロボット操作分野でどの程度効果的か?
  • RQ5現実のタスクにおける交差構造(異なるタスクの軌道が共通状態で収束する構造)は、模倣学習における一般化をどの程度支援するか?

主な発見

  • ステージ1のGTI方策は、$A_0$タスクインスタンス(パンがテーブル上に置かれている状態)で71.4%の成功確率を達成し、成功したロールアウトは$A_G$および$B_G$の両方のゴールに到達した。
  • ステージ1の方策は、$B_0$タスクインスタンス(パンが閉じた容器に入っている状態)で46.7%の成功確率を達成し、そのうち42%の成功ロールアウトが新しいゴール設定に到達した。
  • ステージ2のゴール指向GTI方策は、4つのすべてのスタート・ゴールの組み合わせで50%以上の成功確率を達成した。特に、$A_0$から$B_G$や$B_0$から$A_G$といった新しい組み合わせも含む。
  • オリジナルのデモに基づいて学習したGCBCよりもGTI方策が優れており、自己生成された多様なロールアウトが、ゴール指向の政策学習のためのより強い監督を提供していることを示している。
  • 本手法は、シミュレーション環境および実世界のキッチン操作環境の両方で、未学習のタスク設定への一般化に成功し、そのロバストネスとスケーラビリティを検証した。
  • 現実のタスクに見られる交差構造(異なるタスクの軌道が共通状態で収束する構造)が、構成的一般化を可能にする上で不可欠であることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。