Skip to main content
QUICK REVIEW

[論文レビュー] Navigation by Imitation in a Pedestrian-Rich Environment

Jing Bi, Tianyou Xiao|arXiv (Cornell University)|Nov 1, 2018
Robotic Path Planning Algorithms参考文献 9被引用数 9
ひとこと要約

本論文では、歩行者が多い環境において、ナビゲーション中に専門家の介入から学習することで自律的にナビゲートできるロボットを実現する、介入から学ぶDAggerアルゴリズムを提案する。エラーのバックトラック機能と深層畳み込みニューラルネットワークを統合することで、明示的な歩行者モデリングを伴わずに、多様な現実世界のシナリオにおいても頑健な一般化を達成し、反復学習の度に性能が向上する。

ABSTRACT

Deep neural networks trained on demonstrations of human actions give robot the ability to perform self-driving on the road. However, navigation in a pedestrian-rich environment, such as a campus setup, is still challenging---one needs to take frequent interventions to the robot and take control over the robot from early steps leading to a mistake. An arduous burden is, hence, placed on the learning framework design and data acquisition. In this paper, we propose a new learning-from-intervention Dataset Aggregation (DAgger) algorithm to overcome the limitations brought by applying imitation learning to navigation in the pedestrian-rich environment. Our new learning algorithm implements an error backtrack function that is able to effectively learn from expert interventions. Combining our new learning algorithm with deep convolutional neural networks and a hierarchically-nested policy-selection mechanism, we show that our robot is able to map pixels direct to control commands and navigate successfully in real world without explicitly modeling the pedestrian behaviors or the world model.

研究の動機と目的

  • 大学キャンパスのような複雑で歩行者が多い環境において、従来の模倣学習が分布シフトのため失敗するという課題に対処すること。
  • 展開中に専門家の介入からリアルタイムで相互作用的に学習できる仕組みを提供することで、膨大な事前収集済みのデモンストレーションデータへの依存を低減すること。
  • 人間の修正から反復的にデータを集約することで、ポリシーの一般化性能を向上させるスケーラブルで効率的な模倣学習フレームワークの開発。
  • 明示的な世界モデルや歩行者行動のモデリングを伴わず、RGB画像から制御命令へのエンドツーエンドのナビゲーションを可能にすること。
  • 訓練データに含まれない、以前に見たことのない多様な現実世界の環境において、物理的ロボットプラットフォームで頑健でリアルタイムの性能を示すこと。

提案手法

  • ロボットがミスをした際に専門家の介入から学べるエラーのバックトラック機能を統合した、新規の介入から学ぶDAggerアルゴリズムを提案する。
  • 環境の文脈と観測状態に基づいて、動的に制御ポリシーを選択する階層的ポリシー選択メカニズムを採用する。
  • 深層畳み込みニューラルネットワーク(例:ResNet)を用いて、生のピクセル入力を直接ステアリングおよびスピード制御命令にマッピングする。
  • 最近の状態と予測された行動を格納する固定長のデータキューを実装し、専門家の介入が発生した場合にのみ更新する。
  • Jetson TX2上で10 FPSのリアルタイム推論を実行し、ネットワーク出力をPWM信号に変換してアクチュエーションに利用する。
  • 反復的に新しい介入データを集約し、ポリシー性能が向上するに従い、データ収集の頻度が低下する。

実験結果

リサーチクエスチョン

  • RQ1事前に収集されたデモンストレーションに依存せず、専門家の介入から学習することで、歩行者が多い環境でのナビゲーションが可能になるか?
  • RQ2標準的な行動クラーニングや従来のDAggerと比較して、介入から学ぶDAggerアルゴリズムはポリシーの一般化をどのように向上させるか?
  • RQ3歩行者ダイナミクスの明示的モデリングなしに、ビジュアルベースのエンドツーエンドポリシーが生の画像から制御命令にマッピングできる範囲はどの程度か?
  • RQ4専門家の介入頻度は時間経過とともにどのように変化するか? これはポリシーの向上を示唆するか?
  • RQ5訓練データに含まれない、以前に見たことのない環境やシナリオに対しても、学習済みポリシーは一般化できるか?

主な発見

  • 介入から学ぶDAggerプロセスの各反復において、成功したナビゲーション試行回数が増加し、すべてのシナリオでポリシーの一般化性能が向上していることが示された。
  • 経路追従および歩行者追従タスクにおける「介入なし時間(TWI)」が反復に伴い著しく増加し、より長い自律運転期間を達成していることが確認された。
  • 各シナリオで5回の反復後にトレーニングデータセットのサイズが収束し、ポリシー性能の向上に伴いデータ収集の収益が減少していることが示された。
  • Jetson TX2上で10 FPSのリアルタイム推論を達成し、現実世界の条件下でも安定的かつ応答性の高い制御が可能になった。
  • ロボットは訓練データに含まれない4つの新しいキャンパス地域を正常にナビゲートし、訓練データをはるかに超えた一般化性能を示した。
  • 最小限で的を射た専門家の補正から効果的な学習が可能となり、データ収集の負担を低減しながらも高い性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。