Skip to main content
QUICK REVIEW

[論文レビュー] Agile Autonomous Driving using End-to-End Deep Imitation Learning

Yunpeng Pan, Ching-An Cheng|arXiv (Cornell University)|Sep 21, 2017
Reinforcement Learning in Robotics参考文献 30被引用数 5
ひとこと要約

本論文は、モノクロラルカメラとホイールスピードセンサのみを用いた低コストの搭載センサで、高速オフロード自動走行を実現するエンドツーエンドのディープ模倣学習システムを提示する。オンライン模倣学習を用いてモデル予測制御(MPC)を模倣することで、状態推定やオンライン計画を必要とせず、144 km/hに達するトップスピードを達成し、バッチ模倣学習に比べてコバリアントシフトに対して優れたロバストネスを示す、最先端の性能を達成した。

ABSTRACT

We present an end-to-end imitation learning system for agile, off-road autonomous driving using only low-cost sensors. By imitating a model predictive controller equipped with advanced sensors, we train a deep neural network control policy to map raw, high-dimensional observations to continuous steering and throttle commands. Compared with recent approaches to similar tasks, our method requires neither state estimation nor on-the-fly planning to navigate the vehicle. Our approach relies on, and experimentally validates, recent imitation learning theory. Empirically, we show that policies trained with online imitation learning overcome well-known challenges related to covariate shift and generalize better than policies trained with batch imitation learning. Built on these insights, our autonomous driving system demonstrates successful high-speed off-road driving, matching the state-of-the-art performance.

研究の動機と目的

  • 低コストのエンドツーエンドの自動走行システムを、搭載センサのみを用いて高速オフロード走行に適用する。
  • 複雑で不確実な環境において、従来のモデル計画次第で行動するアプローチの限界を克服する。
  • 模倣学習を通じて反射的制御ポリシーを学習することで、高価なセンサやオンライン計画への依存を低減する。
  • 現実世界のロボット制御における模倣学習のコバリアントシフト問題を調査し、緩和する。
  • オンライン模倣学習がバッチ模倣学習に比べて、高速走行シナリオにおいて一般化性能が優れていることを検証する。

提案手法

  • システムは、高次元の観測値(モノクロラル画像とホイールスピード)を直接、連続的なステアリングおよびアクセル指令にマップするディープニューラルネットワーク(DNN)ポリシーを用いる。
  • エキスパートのデモンストレーションは、高精度なGPSとIMUを備えたモデル予測制御(MPC)によって生成され、ブラックボックスのオラクルとして機能する。
  • オンライン模倣学習が採用され、ロールアウト中に実時間でポリシーを更新することで、コバリアントシフトを低減する。
  • 比較のためのベースラインとして、固定されたエキスパートデモンストレーションデータセット上で訓練されるバッチ模倣学習が用いられる。
  • DNNの最終隠れ層の特徴量のt-SNE可視化を用いて、訓練データとテストデータ間の分布シフトを分析する。
  • ホイールスピード入力を組み込むことで、隠れた車両状態を推定可能となり、リカレントネットワークを用いずに横方向および縦方向の制御を統合する。

実験結果

リサーチクエスチョン

  • RQ1エンドツーエンドのディープ模倣学習システムは、低コストの搭載センサのみを用いて、高速オフロード走行を達成できるか?
  • RQ2異なるポリシー実行に起因するコバリアントシフトの影響下で、オンライン模倣学習はバッチ模倣学習に比べて一般化性能が優れているか?
  • RQ3状態推定やオンライン計画を一切行わず、模倣学習で訓練されたDNNポリシーが、高精度なMPCコントローラーの性能に達することができるか?
  • RQ4特に、画像およびホイールスピードの分布シフトが生じる状況下で、オンラインILとバッチILにおけるDNNポリシーの学習済み特徴表現はどのように異なるか?
  • RQ5ホイールスピード入力は、ポリシーが車両状態を効果的に推定し制御する能力に、どのような寄与をしているか?

主な発見

  • オンライン模倣学習で訓練されたDNNポリシーは、実世界のオフロード走行実験で平均速度約6 m/s、最高速度約8 m/s(スケール換算で108 km/hおよび144 km/h)を達成した。
  • 高価なセンサやオンライン計画を必要とせず、先行するMPCベースの手法と同等の最先端の性能を達成した。
  • オンラインILは、DNNの最終隠れ層における特徴分布が訓練データとテストデータでより一貫的であることが実証され、コバリアントシフトの影響を顕著に低減した。
  • これに対して、バッチILは一貫性のある特徴埋め込みを学習できず、一般化性能が劣り、コーナーケースでの性能が悪化した。
  • ホイールスピード入力を組み込むことで、CNNのみのベースラインに比べてポリシー性能が向上し、DNNがセンサ入力から隠れた車両状態を効果的に推定していることが示された。
  • DNNの特徴マップから、ネットワークが自動的に重要なレーン境界や構造を検出していることが明らかになった一方で、草地や土壌といった関連性の低い特徴は無視していた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。