Skip to main content
QUICK REVIEW

[論文レビュー] Visual Imitation Made Easy

Sarah Young, Dhiraj Gandhi|arXiv (Cornell University)|Aug 11, 2020
Robot Manipulation and Learning参考文献 42被引用数 22
ひとこと要約

本論文では、商業的に入手可能なリーチャーグラバー機器を用いて多様で現実世界のデモンストレーションを収集する、低コストでスケーラブルなインターフェースを提案する。構造からモーション(SfM)と指検出ネットワークを活用して3次元ツール軌道とグリッパー状態を抽出することで、データ拡張を伴う直接的行動クラーニングが可能となり、未確認の物体に対するプッシュタスクで87.5%、スタッキングタスクで62.5%の成功を達成した。これは、シンプルなツールを用いた大規模かつ多様なデータ収集が、ポリシーの一般化を著しく向上させられることを示している。

ABSTRACT

Visual imitation learning provides a framework for learning complex manipulation behaviors by leveraging human demonstrations. However, current interfaces for imitation such as kinesthetic teaching or teleoperation prohibitively restrict our ability to efficiently collect large-scale data in the wild. Obtaining such diverse demonstration data is paramount for the generalization of learned skills to novel scenarios. In this work, we present an alternate interface for imitation that simplifies the data collection process while allowing for easy transfer to robots. We use commercially available reacher-grabber assistive tools both as a data collection device and as the robot's end-effector. To extract action information from these visual demonstrations, we use off-the-shelf Structure from Motion (SfM) techniques in addition to training a finger detection network. We experimentally evaluate on two challenging tasks: non-prehensile pushing and prehensile stacking, with 1000 diverse demonstrations for each task. For both tasks, we use standard behavior cloning to learn executable policies from the previously collected offline demonstrations. To improve learning performance, we employ a variety of data augmentations and provide an extensive analysis of its effects. Finally, we demonstrate the utility of our interface by evaluating on real robotic scenarios with previously unseen objects and achieve a 87% success rate on pushing and a 62% success rate on stacking. Robot videos are available at https://dhiraj100892.github.io/Visual-Imitation-Made-Easy.

研究の動機と目的

  • テレオペレーションやキネスティックティーチングといった制限的なインターフェースに代わって、大規模かつ多様なデータ収集のボトル neck を解消すること。
  • リーチャーグラバーなどの低コストで広く利用可能な補助ツールを用いて、効率的な現実世界のデータ収集を可能にすること。
  • これらのツールを用いて収集したビジュアルデモンストレーションから直接行動クラーニングを実行することで、新しい物体や環境への一般化が可能であることを示すこと。
  • データ拡張とデータ多様性が、現実のロボットシナリオにおけるポリシー性能に与える影響を評価すること。

提案手法

  • データ収集インターフェースおよびロボットのエンドエフェクタとして、商業的に入手可能なリーチャーグラバー機器を用いることで、直接的な転送可能性を確保する。
  • 多様な家庭およびオフィス環境でタスクを実行する際、リーチャーグラバーに取り付けたカメラからRGB動画デモンストレーションを収集する。
  • 収集した動画シーケンスから市販の構造からモーション(SfM)技術を用いて3次元ツール軌道を抽出する。
  • 訓練済みの指検出ネットワークを用いてグリッパーの指状態を検出することで、ビジュアルデモンストレーションからアクションレベルの情報を推定する。
  • 抽出された軌道とアクションを用いて標準的な行動クラーニングでポリシーを学習し、一般化を向上させるためにデータ拡張を適用する。
  • 学習されたポリシーを、同じエンドエフェクタ構成を持つロボットに直接転送することで、未確認の物体に対してゼロショットデプロイを実現する。

実験結果

リサーチクエスチョン

  • RQ1リーチャーグラバーのような補助ツールを、ロボット学習のためのスケーラブルで低コストなインターフェースとして、多様なビジュアルデモンストレーションの収集に使用できるか。
  • RQ2現実世界のデモンストレーションから得られるデータの多様性と規模が、ビジュアルインスティチューション学習におけるポリシーの一般化にどのように影響するか。
  • RQ3データ拡張技術が、非捕捉的プッシュタスクと捕捉的スタッキングタスクにおける未確認の物体に対するポリシー性能をどの程度向上させるか。
  • RQ4補助ツールを用いて収集したビジュアルデモンストレーションからの行動クラーニングが、実際のロボットデプロイにおいて従来の手法を上回る性能を示せるか。

主な発見

  • 提案されたDemoATフレームワークは、未確認の物体に対する非捕捉的プッシュタスクで87.5%、捕捉的スタッキングタスクで62.5%の成功率を達成し、ナイーブな行動クラーニングを著しく上回った。
  • データ拡張、特にプッシュタスクではクロップ+ジッター、スタッキングタスクでは回転+ジッターを適用することで、それぞれBC-MSE指標で0.7%および0.9%の性能向上が得られた。
  • 訓練データの50%のみを用いてデータ拡張を適用した場合、プッシュタスクおよびスタッキングタスクの両方で、100%のデータを用いたナイーブな行動クラーニングの性能を上回った。
  • 50%のデータに拡張を適用して学習したモデルは、プッシュタスクの最初の物体に到達する際100%の成功を達成し、限られたデータからの強力な一般化を示した。
  • 多くのシーンにわたる間引き観測を持つ多様なデータセットは、繰り返しの多いシーンを含む少ない多様性のデータセットよりも優れた性能を示し、テスト誤差が1.4%低く(0.067 vs. 0.081)なった。
  • データ拡張による性能向上は、タスクの後半段階で顕著に現れ、初期リーチフェーズを除いたスタッキング成功率が33.4%向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。