Skip to main content
QUICK REVIEW

[論文レビュー] Avoidance of Manual Labeling in Robotic Autonomous Navigation Through Multi-Sensory Semi-Supervised Learning

Junhong Xu, Shangyue Zhu|arXiv (Cornell University)|Sep 22, 2017
Reinforcement Learning in Robotics参考文献 30被引用数 3
ひとこと要約

本論文では、マルチセンサ融合を用いてロボットの状態を自動的にラベル付けすることで、ロボットナビゲーションにおける人間のラベル付けを置き換える自己教師付き模倣学習フレームワーク、Multi-Sensory Semi-Supervised Learning (MS3L) を提案する。実際の屋内環境において人間に近い性能を達成し、予期しない故障時においても人間のオペレーターを上回る。初期の1回の人的初期化の後、繰り返し専門家の質問を必要とせず、反復的でない学習が可能となる。

ABSTRACT

Imitation learning holds the promise to address challenging robotic tasks such as autonomous navigation. It however requires a human supervisor to oversee the training process and send correct control commands to robots without feedback, which is always prone to error and expensive. To minimize human involvement and avoid manual labeling of data in the robotic autonomous navigation with imitation learning, this paper proposes a novel semi-supervised imitation learning solution based on a multi-sensory design. This solution includes a suboptimal sensor policy based on sensor fusion to automatically label states encountered by a robot to avoid human supervision during training. In addition, a recording policy is developed to throttle the adversarial affect of learning too much from the suboptimal sensor policy. This solution allows the robot to learn a navigation policy in a self-supervised manner. With extensive experiments in indoor environments, this solution can achieve near human performance in most of the tasks and even surpasses human performance in case of unexpected events such as hardware failures or human operation errors. To best of our knowledge, this is the first work that synthesizes sensor fusion and imitation learning to enable robotic autonomous navigation in the real world without human supervision.

研究の動機と目的

  • ロボットナビゲーションの模倣学習における人的監視の高コスト性と不正確さを解消する。
  • 学習中に繰り返し専門家への質問を排除するために、人的ラベル付けをセンサ融合による自動状態ラベル付けに置き換える。
  • 人的オペレーターへの依存を最小限に抑えつつ、高いナビゲーション性能を維持する耐障害性の高い学習フレームワークを開発する。
  • サブ最適なセンサポリシーからの学習を、記録ポリシーによって制御することで、自己教師付き学習中の安全性を確保する。
  • ロボットが最小限の人的介入で実際の屋内環境においてナビゲーションを学習でき、さらにはハードウェア障害などの予期しない状況でも人間の性能を上回ることを実証する。

提案手法

  • 画像(RGB)と非画像(深度、IMU)センサを統合したマルチセンサディープラーニングフレームワークを採用し、状態表現を生成する。
  • センサ融合に基づくサブ最適なセンサポリシーを設計し、ロボットが遭遇する観測を自動的にラベル付けすることで、人的ラベル付けを置き換える。
  • 安全性ポリシーを模倣した記録ポリシーを導入し、サブ最適なセンサポリシーからナビゲーションポリシーへの知識伝達の度合いを制御する。
  • 1回の人的デモンストレーションでナビゲーションポリシーを初期化し、その後、ロボット自身の相互作用から得たデータを用いた自己教師付き学習を実施する。
  • ノイズや誤ったラベルの悪影響を軽減するため、模倣学習とβ重み付き記録ポリシーを組み合わせた損失関数を適用する。
  • 自律的探索中に収集したデータを用いて、エンドツーエンドでナビゲーションポリシーを訓練し、専門家のフィードバックへの依存を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ11回の初期人的デモンストレーションのみを用いて、繰り返し人的ラベル付けを必要とせずにロボットナビゲーションポリシーを学習できるか?
  • RQ2実世界環境における模倣学習のための信頼性の高い状態ラベルを、センサ融合を活用して自動生成できるか?
  • RQ3自己教師付き学習中に人的監視者を置き換えるために、サブ最適なセンサポリシーはどの程度有効か?
  • RQ4記録ポリシーは、サブ最適なポリシーからの学習がもたらす悪影響をどの程度軽減できるか?
  • RQ5自己教師付きナビゲーションポリシーは、ハードウェア障害などの予期しない事象において、人間のオペレーターを上回ることができるか?

主な発見

  • MS3Lは3つの実世界ナビゲーションタスクのうち2つで人間の性能に近く、人的監視への依存を顕著に低減した。
  • コントローラーにガウスノイズを追加してシミュレートしたハードウェア障害の状況下でも、MS3Lは人間のオペレーターを上回った。人間のオペレーターは予期しない出来事に対応できなかった。
  • テストされたすべての環境において、ナビゲーションポリシーはサブ最適なセンサポリシーの性能を上回った。これは、自己教師付き学習中に効果的な自己改善が行われたことを示している。
  • DAggerベースラインと比較して、MS3Lは訓練データ量を1/2.8にまで削減しながら、初期化後の人的ラベル付けをゼロに保ちつつ、同等またはより高い性能を達成した。
  • β = 0.99の記録ポリシーは、サブ最適なセンサポリシーからの学習に起因する悪影響を効果的に軽減した。これは、試行の間で安定した性能を示した。
  • システムは、混雑した通路やごみの多い教室など、複雑で動的な環境においても耐性を示した。このような環境では、センサポリシーが距離推定エラーのため頻繁に失敗していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。