Skip to main content
QUICK REVIEW

[論文レビュー] A Fast Integrated Planning and Control Framework for Autonomous Driving via Imitation Learning

Liting Sun, Cheng Peng|arXiv (Cornell University)|Jul 9, 2017
Advanced Control Systems Optimization被引用数 9
ひとこと要約

本論文は、模倣学習と最適化に基づく制御を組み合わせることで、高速で安全かつ滑らかな自動運転を実現する二層階層型フレームワークを提案する。ポリシー層では、長時間スパンのモデル予測制御(MPC)を模倣する軽量なニューラルネットワークが高品質な軌道を生成し、短時間スパンの最適化層がリアルタイムの実行可能性と安全性を保証する。オンラインDAggerの精錬により、反復的に性能が向上する。

ABSTRACT

For safe and efficient planning and control in autonomous driving, we need a driving policy which can achieve desirable driving quality in long-term horizon with guaranteed safety and feasibility. Optimization-based approaches, such as Model Predictive Control (MPC), can provide such optimal policies, but their computational complexity is generally unacceptable for real-time implementation. To address this problem, we propose a fast integrated planning and control framework that combines learning- and optimization-based approaches in a two-layer hierarchical structure. The first layer, defined as the "policy layer", is established by a neural network which learns the long-term optimal driving policy generated by MPC. The second layer, called the "execution layer", is a short-term optimization-based controller that tracks the reference trajecotries given by the "policy layer" with guaranteed short-term safety and feasibility. Moreover, with efficient and highly-representative features, a small-size neural network is sufficient in the "policy layer" to handle many complicated driving scenarios. This renders online imitation learning with Dataset Aggregation (DAgger) so that the performance of the "policy layer" can be improved rapidly and continuously online. Several exampled driving scenarios are demonstrated to verify the effectiveness and efficiency of the proposed framework.

研究の動機と目的

  • リアルタイム自動運転における長時間スパンのモデル予測制御(MPC)の計算不能性に対処すること。
  • 長期間のMPCの品質を維持しながらリアルタイム実行が可能な高速で安全かつ滑らかな計画・制御フレームワークの開発。
  • カスタマイズされたDAgger手順を用いたオンライン模倣学習により、ポリシーの忠実度を継続的に向上させること。
  • 仮想的特徴量を用いて、追い越し、車両追従、直進走行などの複雑なシナリオへの一般化を可能とすること。

提案手法

  • 二層階層型アーキテクチャを採用:小さなニューラルネットワークを備えたポリシー層が長期間のMPC行動を模倣し、実行層が短時間スパンの最適化によりリアルタイム追従を実現する。
  • 多様な走行シナリオにわたる一般化を可能にするために、極めて代表的な特徴量が選択される。
  • サンプリング済みDAggerを用いたオンライン模倣学習が採用される:ポリシーは実際のシナリオでテストされ、失敗事例は専門家MPCによってラベル付けされ、反復的に訓練データセットが拡張される。
  • 仮想的特徴量(例:仮想の縁石や仮想の隣接レーン車両)が導入され、マルチレーン走行や車両追従シナリオへのポリシーの一般化が可能となる。
  • 集約されたデータを用いてポリシー層を反復的に再訓練することで、忠実度と未知の状況へのロバスト性が向上する。
  • 実行層は各タイムステップで制約付き最適化問題を解き、参照軌道を追従すると同時に、短期的な安全性和実行可能性を保証する。

実験結果

リサーチクエスチョン

  • RQ1学習されたポリシーは、長期間にわたる最適かつ安全なMPCの走行行動を模倣しつつ、リアルタイム実行を可能にするか?
  • RQ2コンパクトなニューラルネットワークは、最小限の計算コストで多様な走行シナリオにおいて高い性能を達成できるか?
  • RQ3オンラインDAggerに基づく精錬は、複雑またはレアなシナリオにおけるポリシーのロバスト性と一般化能力を顕著に向上させられるか?
  • RQ4仮想的特徴量を用いることで、明示的なシナリオのデモンストレーションが不要な状況でも、ポリシーの適用範囲をマルチレーン走行や車両追従に拡張できるか?

主な発見

  • 提案されたフレームワークは、加速と旋回を早期に開始することで、滑らかで安全な追い越しを実現し、急ブレーキや縁石衝突を回避する。
  • 短時間スパンのMPC単体と比較して、本フレームワークは、大きなステアリング角や繰り返し停止といった攻撃的行動を大幅に低減し、走行品質が著しく向上する。
  • カスタマイズされたDAgger手順はポリシー性能の向上に効果的である:反復的精錬の結果、当初データ不足により誤分類されていたシナリオでも、直進走行が正常に完了するようになった。
  • 仮想的特徴量(例:仮想の隣接レーン車両や仮想の縁石)を用いることで、学習されたポリシーは、車両追従やマルチレーン走行といった複雑なシナリオに良好に一般化する。
  • 小さなニューラルネットワークを用いてもリアルタイム性能を維持でき、高速な推論を実現しながら、長時間スパンMPCの安全性と最適性を保持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。