Skip to main content
QUICK REVIEW

[論文レビュー] Sample-efficient Adversarial Imitation Learning from Observation

Faraz Torabi, Sean Geiger|arXiv (Cornell University)|Jun 18, 2019
Adversarial Robustness in Machine Learning参考文献 25被引用数 5
ひとこと要約

本稿では、軌道中心の強化学習(LQR)と観測からの敵対的模倣(GAIfO)を組み合わせることで、学習効率を向上させるサンプル効率の高い模倣学習アルゴリズム、LQR+GAIfOを提案する。LQRを用いて高品質で低レベルの軌道を生成し、それらが敵対的ポリシー学習をガイドすることで、GAIfO単体と比較して収束が速く、より優れたサンプル効率を達成する。これにより、少ない示範と学習反復回数で物理的ロボットシステムにおける成功した模倣が可能になる。

ABSTRACT

Imitation from observation is the framework of learning tasks by observing demonstrated state-only trajectories. Recently, adversarial approaches have achieved significant performance improvements over other methods for imitating complex behaviors. However, these adversarial imitation algorithms often require many demonstration examples and learning iterations to produce a policy that is successful at imitating a demonstrator's behavior. This high sample complexity often prohibits these algorithms from being deployed on physical robots. In this paper, we propose an algorithm that addresses the sample inefficiency problem by utilizing ideas from trajectory centric reinforcement learning algorithms. We test our algorithm and conduct experiments using an imitation task on a physical robot arm and its simulated version in Gazebo and will show the improvement in learning rate and efficiency.

研究の動機と目的

  • 実世界のロボットアプリケーションにおける敵対的模倣学習(GAIfO)の高いサンプル複雑性に対処すること。
  • アクション情報が入手不可な状態軌道のみが利用可能な模倣から観測(IfO)におけるサンプル効率の向上。
  • 必要な示範数と学習反復回数を削減することで、物理的ロボットにおける有効な模倣学習を可能にすること。
  • 軌道中心のLQRのサンプル効率と、GAIfOにおける深層ニューラルネットワークのポリシー容量を統合すること。
  • シミュレーションと物理的6-DOFロボットアームの両方で手法を検証し、シミュレーションから現実への移行可能性を示すこと。

提案手法

  • 高品質で低レベルの軌道コントローラーを生成するため、線形二次調節器(LQR)を統合し、ポリシー探索をガイドする。
  • LQRが生成した軌道を、GAIfOフレームワーク内のジェネレータネットワークの初期化およびガイドとして使用する。
  • ジェネレータとディスクライマーが区別する専用の敵対的生成ネットワーク(GAN)の設定を採用する。
  • ディスクライマーのフィードバックを用いてジェネレータ(模倣ポリシー)を敵対的に訓練する一方で、LQRを用いてサンプル効率の良い探索を実現する。
  • LQR軌道からの重要度重み付きサンプリングを採用し、ポリシー更新の効率と一般化性能を向上させる。
  • ディスクライマーに畳み込み層を追加することで、視覚的観測を処理できるように拡張し、アクションのアノテーションが不要な動画データからの模倣を可能にする。

実験結果

リサーチクエスチョン

  • RQ1LQRとGAIfOを組み合わせることで、観測からの模倣に必要なサンプル数を顕著に削減できるか?
  • RQ2サンプル効率および最終的な模倣精度の観点から、LQR+GAIfOはGAIfO単体と比較してどの程度優れているか?
  • RQ3シミュレーションで訓練されたポリシーが、物理的ロボットアームにどの程度成功裏に移行できるか?
  • RQ4LQRの統合が、トレーニング中に見られなかった新たなターゲットポイントへの一般化をどの程度向上させるか?
  • RQ5視覚的観測のみで動作するように拡張可能か?これにより、アクションアノテーションが不要な動画示範からの模倣が可能になるか?

主な発見

  • GAIfO単体と比較して、LQR+GAIfOははるかに少ない学習反復回数と示範サンプル数で成功した模倣を達成し、サンプル効率の向上を示した。
  • 収束が速く、特に最初の60反復以内ではGAIfOを上回る性能を示した。
  • LQR+GAIfOは約60反復目で最終的な性能が低下する傾向を示すが、これはディスクライマーとコントローラー間の学習率の不一致に起因すると考えられる。しかし、サンプル制限のある初期段階では依然としてGAIfOを上回る性能を示した。
  • シミュレーションで訓練されたポリシーは物理的ロボットアームに成功裏に一般化され、実世界での性能はシミュレータの結果を上回った。これは、物理的ノイズに起因するより高い探索性による可能性がある。
  • LQRの統合により、より多くの示範軌道が提供されるにつれて、新たなターゲットポイントへの一般化性能が向上した。これは、ディスクライマーが一般化されたコスト関数を学習したためと推察される。
  • 畳み込みディスクライマーによる視覚的観測への拡張は、将来的に有望な方向性である。これは、アクションアノテーションが不要な動画示範からの模倣を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。