Skip to main content
QUICK REVIEW

[論文レビュー] Learning and Retrieval from Prior Data for Skill-based Imitation Learning

Soroush Nasiriany, Tian Gao|arXiv (Cornell University)|Oct 20, 2022
Reinforcement Learning in Robotics被引用数 7
ひとこと要約

SAILORは、事前デモデータを活用することで、新しい操作タスクの学習におけるデータ効率性とロバスト性を向上させるスキルベースの模倣学習フレームワークを提案する。時間的予測可能性の目的関数を用いた構造的なスキル表現と、検索ベースのデータ拡張によるポリシーの監視拡大を組み合わせることで、シミュレーションおよび現実世界の設定において、最先端の模倣学習およびオフライン強化学習手法を著しく上回る性能を達成する。

ABSTRACT

Imitation learning offers a promising path for robots to learn general-purpose behaviors, but traditionally has exhibited limited scalability due to high data supervision requirements and brittle generalization. Inspired by recent advances in multi-task imitation learning, we investigate the use of prior data from previous tasks to facilitate learning novel tasks in a robust, data-efficient manner. To make effective use of the prior data, the robot must internalize knowledge from past experiences and contextualize this knowledge in novel tasks. To that end, we develop a skill-based imitation learning framework that extracts temporally extended sensorimotor skills from prior data and subsequently learns a policy for the target task that invokes these learned skills. We identify several key design choices that significantly improve performance on novel tasks, namely representation learning objectives to enable more predictable skill representations and a retrieval-based data augmentation mechanism to increase the scope of supervision for policy training. On a collection of simulated and real-world manipulation domains, we demonstrate that our method significantly outperforms existing imitation learning and offline reinforcement learning approaches. Videos and code are available at https://ut-austin-rpl.github.io/sailor

研究の動機と目的

  • 複雑で長時間にわたるタスクにおける従来の模倣学習の高いデータ要件と脆い一般化性能の課題に対処すること。
  • 過去のタスクからのインタラクションデータを活用することで、データ効率性とポリシーのロバスト性を向上させること。
  • 過去の経験から得た知識を内部化し、新しいタスクに文脈的に適応可能なスキルベースのフレームワークを開発すること。
  • 予測不可能なスキル表現やポリシー学習のための不十分な監視という、既存のスキルベースの模倣学習の限界を克服すること。
  • 構造的なスキル学習と検索拡張ポリシー学習を組み合わせることで、未観測の操作タスクにおいて強力な一般化性能を達成できることを示すこと。

提案手法

  • 変分オートエンコーダに時間的予測可能性の目的関数を組み合わせることで、事前データから時間的に拡張されたセンサモータスキルを抽出するスキルベースの模倣学習フレームワーク。
  • 時間的予測可能性の目的関数は、部分軌道間の時間的距離を推定し、より予測可能で分離された潜在的スキル空間を促進する。
  • 検索ベースのデータ拡張メカニズムにより、ターゲットタスクのデモと類似した潜在的スキルを持つ過去の部分軌道を特定し、ポリシーの監視範囲を拡大する。
  • ポリシーは潜在的スキルを出力するように訓練され、高レベルのタスク推論と低レベルのアクション実行を分離する階層的意思決定を可能にする。
  • マルチステージのトレーニングパイプラインを採用:まず事前データ上でスキルモデルを事前学習し、次に、収集した過去データで拡張されたターゲットタスクのデモでポリシーをファインチューニングする。
  • 最適なパフォーマンスを得るためのハイパーパrameterチューニングが実施され、部分軌道長H=10、スキル潜在次元64、最大300,000件の過去サンプルから検索を実施する。

実験結果

リサーチクエスチョン

  • RQ1どのようにして過去のデータを有効に活用することで、新しい操作タスクの模倣学習におけるデータ効率性を向上させられるか?
  • RQ2スキル表現学習におけるどのような設計選択が、より予測可能で一般化可能なスキルを生み出すのか?
  • RQ3検索拡張データ増強は、限られたターゲットタスクのデモセットにおいて、ポリシーの一般化性能を向上させ、過学習を軽減する程度はどの程度か?
  • RQ4時間的予測可能性をスキル学習に統合した場合、標準的なVAEベースのアプローチと比較して、下流のポリシー性能にどのような差が生じるか?
  • RQ5スキル学習とポリシー学習の両方で過去データを統合するスキルベースのフレームワークは、過去データをスキル学習にのみ使用する手法を上回る性能を発揮できるか?

主な発見

  • SAILORは、さまざまなシミュレーションおよび現実世界の操作タスクにおいて、最先端の模倣学習およびオフライン強化学習手法を著しく上回る性能を達成する。
  • 時間的予測可能性の目的関数の導入により、より構造的で予測可能なスキル表現が得られ、ポリシーが関係のないスキルを実行する傾向が軽減される。
  • 検索ベースのデータ拡張により、ポリシー学習の有効な監視範囲が拡大され、小規模なターゲットタスクのデモセットにおける過学習と共変量シフトのリスクが軽減される。
  • Franka KitchenおよびCALVIN環境では、SAILORはBC-RNN、IQL、FISTを上回る高い成功率を達成しており、特に長時間にわたるタスクにおいて顕著である。
  • 本手法は、現実世界のタスク、特にBreakfastおよびCook環境においても、平均80%を超える成功率を示す強力なゼロショット一般化性能を示す。
  • アブレーションスタディの結果、時間的予測可能性の目的関数と検索ベースの拡張の両方が、性能向上に不可欠であることが確認され、それぞれがデータ効率性とロバスト性の向上に顕著な寄与をしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。