Skip to main content
QUICK REVIEW

[論文レビュー] Understanding Multi-Modal Perception Using Behavioral Cloning for Peg-In-a-Hole Insertion Tasks

Yifang Liu, Diego Romeres|arXiv (Cornell University)|Jul 22, 2020
Robot Manipulation and Learning参考文献 24被引用数 9
ひとこと要約

本論文では、視覚、力・トルク、プロプライオセプションのマルチモーダルセンサ入力を用いたピッグインアホール挿入タスクにおけるロバスト性を向上させるために、マルチステップ先読み損失関数を用いた行動クローンの手法を提案する。自動デモンストレーションを用いて訓練し、テスト時にエンドエフェクタ位置依存性を避けることで、ロボットの全ワークスペースで100%の成功率を達成した。これは、ゴールに依存しない制御器が、正確なエンドエフェクタフィードバックに依存するものよりも優れていることを示している。

ABSTRACT

One of the main challenges in peg-in-a-hole (PiH) insertion tasks is in handling the uncertainty in the location of the target hole. In order to address it, high-dimensional sensor inputs from sensor modalities such as vision, force/torque sensing, and proprioception can be combined to learn control policies that are robust to this uncertainty in the target pose. Whereas deep learning has shown success in recognizing objects and making decisions with high-dimensional inputs, the learning procedure might damage the robot when applying directly trial- and-error algorithms on the real system. At the same time, learning from Demonstration (LfD) methods have been shown to achieve compelling performance in real robotic systems by leveraging demonstration data provided by experts. In this paper, we investigate the merits of multiple sensor modalities such as vision, force/torque sensors, and proprioception when combined to learn a controller for real world assembly operation tasks using LfD techniques. The study is limited to PiH insertions; we plan to extend the study to more experiments in the future. Additionally, we propose a multi-step-ahead loss function to improve the performance of the behavioral cloning method. Experimental results on a real manipulator support our findings, and show the effectiveness of the proposed loss function.

研究の動機と目的

  • 視覚、力・トルク、エンドエフェクタ測定値を組み合わせることで、ロボットのピッグインアホール挿入タスクの性能が向上するかを調査すること。
  • 行動クローンにおける状態分布シフトの課題に対処するため、マルチステップ先読み損失関数を提案すること。
  • 不確実なターゲット位置の状況下で、高精度な制御を達成するためにエンドエフェクタ位置が必要かどうかを評価すること。
  • 現実世界のロボット操作において、生のセンサデータと特徴工学的入力のどちらがより優れた一般化性能を示すかを特定すること。
  • 全ワークスペースにわたる一般化を実現するゴールに依存しない制御器を開発すること。

提案手法

  • 著者たちは、人間のデモンストレーションではなく、自動デモンストレーションから学習する行動クローンを用い、ノイズとコストを低減する。
  • 新規のマルチステップ先読み損失関数を導入し、制御方針が複数の将来ステップ(K=2,3)にわたり、専門家軌道に近い状態へ到達するような行動を予測するように訓練する。
  • 視覚(ウェイストカメラからのRGB画像)、力・トルクセンサ読み取り値、エンドエフェクタ位置測定値のマルチモーダルセンサ入力を統合する。
  • 方策ネットワークは、生のセンサ入力と手作業で作成された特徴の両方を比較するアブレーションスタディを含む、ResNetベースのモデルとして実装される。
  • 訓練プロセスは、将来のステップのシーケンスにわたり、予測された行動とデモンストレーションされた行動の差を最小化する教師あり学習の目的関数を用いる。
  • 一般化性とターゲット位置の不確実性に対するロバスト性を高めるために、テスト時にエンドエフェクタ位置を直接使用しないようにする。

実験結果

リサーチクエスチョン

  • RQ1視覚、力・トルク、エンドエフェクタデータを組み合わせることで、ピッグインアホール挿入タスクの性能が向上するか?
  • RQ2マルチステップ先読み損失関数は、実際のロボットシステムにおける行動クローンの状態分布シフトの影響を軽減できるか?
  • RQ3成功した挿入にはエンドエフェクタ位置が必要か、それとも視覚と力フィードバックのみでゴールに依存しない制御器を学習できるか?
  • RQ4生のセンサデータと特徴工学的入力のどちらが、ターゲット位置の不確実性の状況下でより優れた一般化性能を示すか?
  • RQ5マルチステップ先読み損失のホライズン(K=1,2,3)は、制御器の成功率とロバスト性にどのように影響するか?

主な発見

  • 3ステップ先読み損失関数は、標準の1ステップ先読み損失関数を著しく上回り、ResNetベースの制御器では力・トルク特徴を用いることで100%の成功率を達成した。
  • 2ステップ先読み損失で訓練された制御器も100%の成功率を達成し、マルチステップの監視の有効性を示した。
  • 視覚のみの制御器では1ステップ先読み損失で完全に失敗(0.30%の成功率)したが、マルチステップ先読み損失を用いることで性能が著しく向上した。
  • 最も優れた性能を示した制御器は、力・トルク特徴と3ステップ先読み損失を組み合わせており、ロボットの全ワークスペースで100%の成功率を達成した。
  • ほとんどの設定において、生のセンサデータが特徴工学的入力よりも優れていたため、生信号からのエンドツーエンド学習がより効果的であると考えられた。
  • テスト時にエンドエフェクタ位置を排除したところ、ゴールに依存しない、非常にロバストな制御器が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。