Skip to main content
QUICK REVIEW

[論文レビュー] Human-in-the-Loop Imitation Learning using Remote Teleoperation

Ajay Mandlekar, Danfei Xu|arXiv (Cornell University)|Dec 12, 2020
Reinforcement Learning in Robotics参考文献 43被引用数 10
ひとこと要約

本論文は、ポリシー実行中に人間の介入を収集することで、ロボット操作ポリシーの性能を向上させる、遠隔テレオペレーションを用いた人間を含むループ型模倣学習フレームワークを提案する。Intervention Weighted Regression (IWR) を導入し、介入のタイミングを活用して、高リスクなボトルネック領域での学習を優先する。6自由度の困難なタスク、たとえばロボットの糸通しやコーヒーメーキングにおいて、完全なデモベースラインや他の介入ベースの手法を著しく上回る性能を発揮する。

ABSTRACT

Imitation Learning is a promising paradigm for learning complex robot manipulation skills by reproducing behavior from human demonstrations. However, manipulation tasks often contain bottleneck regions that require a sequence of precise actions to make meaningful progress, such as a robot inserting a pod into a coffee machine to make coffee. Trained policies can fail in these regions because small deviations in actions can lead the policy into states not covered by the demonstrations. Intervention-based policy learning is an alternative that can address this issue -- it allows human operators to monitor trained policies and take over control when they encounter failures. In this paper, we build a data collection system tailored to 6-DoF manipulation settings, that enables remote human operators to monitor and intervene on trained policies. We develop a simple and effective algorithm to train the policy iteratively on new data collected by the system that encourages the policy to learn how to traverse bottlenecks through the interventions. We demonstrate that agents trained on data collected by our intervention-based system and algorithm outperform agents trained on an equivalent number of samples collected by non-interventional demonstrators, and further show that our method outperforms multiple state-of-the-art baselines for learning from the human interventions on a challenging robot threading task and a coffee making task. Additional results and videos at https://sites.google.com/stanford.edu/iwr .

研究の動機と目的

  • 微小な行動誤差が高精度な操作タスクで失敗を引き起こす模倣学習における共変量シフトの問題に対処すること。
  • ポリシー実行中に障害が発生する際、遠隔で監視し、リアルタイムに人間のオペレーターが介入できること。
  • 人間の介入データを効果的に活用して、ボトルネック領域におけるポリシーの一般化性能を向上させるアルゴリズムの開発。
  • 反復的な再訓練を伴う介入ベースのデータ収集が、完全な人間デモの収集を上回ることの実証。
  • 複数の異なる人間オペレーターおよび物理的に挑戦的な接触を伴う操作タスクにおいて、手法の妥当性を検証すること。

提案手法

  • 遠隔テレオペレーションシステムにより、人間のオペレーターがポリシー実行を監視し、障害が予想される段階で完全な制御を一時的に取得できる。
  • 人間の介入は、障害状態に近い状態でオペレーターが制御を引き取り、正常な遷移後に制御を元に戻す状態-行動ペアとして記録される。
  • 提案されたIntervention Weighted Regression (IWR)アルゴリズムは、介入タイミングに基づいて訓練データを再重み付けし、ボトルネック領域への進入点に近い行動に対して高い重みを付与する。
  • IWRは介入信号を暗黙の報酬信号として扱い、高リスク領域を安全かつ成功裏に通過する軌道を学習するのを促進する。
  • ポリシーは、蓄積された介入データに基づき反復的に再訓練され、ボトルネック領域での性能が段階的に向上する。
  • 本システムは、多様な人間オペレーターからのスケーラブルなデータ収集をサポートし、クラウドソーシング学習に適している。

実験結果

リサーチクエスチョン

  • RQ1ポリシー実行中に遠隔で人間の介入が行われることで、高精度なボトルネックを持つ6-DoF操作タスクの性能が向上するか?
  • RQ2介入データを重み付き回帰手法(IWR)で活用することで、完全なデモを用いた標準的な模倣学習よりもポリシー性能が向上するか?
  • RQ3反復的データ収集(複数ラウンドの介入)と1ラウンドのデータ収集を比較した場合、最終的なポリシー成功確率にどのような差が生じるか?
  • RQ4提案手法は、異なる人間オペレーターおよび異なるベースポリシーに対しても一般化可能か?
  • RQ5同じデータセットで学習した場合、IWRは他の介入ベースの学習ベースラインを上回るか?

主な発見

  • ロボットの糸通しタスクでは、提案手法が87.3%の成功率を達成し、Full Demosベースライン(76.7%)およびHG-DAggerやIWR-NBなどの他の介入ベースのベースラインを著しく上回った。
  • コーヒーマシンタスクでは、3名のオペレーター平均で87.5%の成功率を達成し、Full Demosベースライン(64.9%)およびHG-DAggerベースライン(69.6%)を上回った。
  • 複数の異なる人間オペレーターに対して一貫した改善が見られ、多様なデモンストレーター間でのロバストネスと一般化性能が示された。
  • 他の手法で収集されたデータセットで学習した場合でも、提案されたIWR手法は自ら収集したデータセットで学習した場合に近い性能を達成しており、優れたデータ利用効率を示している。
  • 複数ラウンドの介入を伴う反復的データ収集は、1ラウンドのデータ収集を上回り、特にコーヒーマシンタスクでは最終的な成功率が7%低い結果となった。
  • 結果から、介入データは、介入タイミングを知的に重み付けすることで、特に複雑で接触を伴う操作タスクにおいて、完全なデモデータよりも効果的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。