Skip to main content
QUICK REVIEW

[論文レビュー] Learning Agile Skills via Adversarial Imitation of Rough Partial Demonstrations

Chenhao Li, Marin Vlastelica|arXiv (Cornell University)|Jun 23, 2022
Adversarial Robustness in Machine Learning被引用数 8
ひとこと要約

本論文では、WASABIと呼ばれるワッサーシュタインGANに基づく敵対的模倣学習手法を提案する。この手法により、物理的に不適合な粗い部分的ヒューマンデモから、四足歩行ロボットがバックフリップなどの複雑なスキルを学習可能となる。手で保持された動きからの状態行動遷移を用いた敵対的訓練により、タスクに依存しない報酬関数を推定し、シミュレーションから実世界への展開が可能な高パフォーマンスなポリシーを実現する。

ABSTRACT

Learning agile skills is one of the main challenges in robotics. To this end, reinforcement learning approaches have achieved impressive results. These methods require explicit task information in terms of a reward function or an expert that can be queried in simulation to provide a target control output, which limits their applicability. In this work, we propose a generative adversarial method for inferring reward functions from partial and potentially physically incompatible demonstrations for successful skill acquirement where reference or expert demonstrations are not easily accessible. Moreover, we show that by using a Wasserstein GAN formulation and transitions from demonstrations with rough and partial information as input, we are able to extract policies that are robust and capable of imitating demonstrated behaviors. Finally, the obtained skills such as a backflip are tested on an agile quadruped robot called Solo 8 and present faithful replication of hand-held human demonstrations.

研究の動機と目的

  • 専門家のデモが入手不可能、またはロボットと物理的に不適合な状況において、高動的なロボットスキルを学習する課題に対処すること。
  • 強化学習における手作業で設計された報酬関数への依存を減らし、最小限で不完全なデモから意味のある報酬を推定すること。
  • 専門家のポリシーも全状態遷移も入手不可な状況で、部分的かつ手で保持されたヒューマンモーションデータのみを用いて、シミュレーションから実世界への展開を可能にする。
  • ワッサーシュタインGANの定式化を用いることで、モード崩壊を軽減し、学習の安定性を向上させることでポリシーの頑健性と一般化性能を向上させること。

提案手法

  • 敵対的生成モデルとしてのワッサーシュタインGAN(WASABI)フレームワークを採用し、粗いデモから得られる専門家に似た状態行動遷移と、ポリシーが生成する遷移を区別するディスクラミネーターを用いる。
  • ディスクラミネーターの出力を報酬信号とみなして強化学習によりポリシーを訓練し、専門家の行動にアクセスせずに模倣を実現する。
  • ディスクラミネーターへの入力を遷移ベースにし、時間的整合性を高め、モード崩壊を低減するために、時間窓Hの状態行動ペアのシーケンスを用いる。
  • タスクに依存しない正則化項(例:停止状態報酬、速度追従報酬)を導入し、タスク固有の報酬が存在しない状況での学習を安定化させる。
  • 比較のための最小二乗GAN(LSGAN)ベースラインを採用し、不完全でノイズの多いデモを扱う際のワッサーシュタイン定式化の優位性を示す。
  • アクティブな速度制御とシングルフリップ実行を実現するために、観測空間の条件付き変更と報酬形状の工夫をフレームワークに統合する。

実験結果

リサーチクエスチョン

  • RQ1生成的敵対的模倣学習手法は、粗く不完全で物理的に不適合なヒューマンデモから、効果的な報酬関数を推定できるか?
  • RQ2専門家の行動が入手不可な状況下で、LSGANとワッサーシュタインGANの損失関数の選択がポリシー学習のパフォーマンスと頑健性に与える影響は何か?
  • RQ3不完全または手で保持されたデモから学習したポリシーは、バックフリップのような実世界のアジャイルなロボット行動にどの程度一般化可能か?
  • RQ4ディスクラミネーターの観測時間窓(H)が、部分的デモを用いた模倣学習におけるポリシーの収束性と性能に与える影響は何か?
  • RQ5追加の報酬形状(例:速度追従、停止状態報酬)により、専門家のデモなしで運動時間の制御や着地後の安定性を制御可能か?

主な発見

  • WASABIは、四足歩行ロボットと物理的に不適合な手で保持された部分的デモのみを用いて、バックフリップポリシーを成功裏に学習した。
  • 実世界のSolo 8四足歩行ロボットにおいて、ヒューマンデモの忠実な再現が達成され、動的時間適合(DTW)距離が軌道の高精度な一致を示した。
  • ワッサーシュタインGAN定式化を用いて訓練されたポリシーは、シミュレーションおよび実世界での展開においてLSGANベースラインを上回り、不完全またはノイズの多いデモを扱う際の優位性を示した。
  • 長いディスクラミネーター観測時間窓(H=8)は、スタンドアップやバックフリップなどのタスクにおいて、ポリシーの収束性と性能を向上させ、モード崩壊を低減し、時間的整合性を向上させた。
  • ヒューマンデモデータ内の速度ばらつきを活用することで、アクティブな速度制御が実現され、ロボットが必要に応じて歩行速度を調整可能となった。
  • ポリシーの観測空間を変更してフリップ完了を検出させ、停止状態報酬を適用することで、シングルフリップ実行が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。