Skip to main content
QUICK REVIEW

[論文レビュー] An Auto-tuning Framework for Autonomous Vehicles

Haoyang Fan, Zhongpu Xia|arXiv (Cornell University)|Aug 14, 2018
Autonomous Vehicle Technology and Safety参考文献 11被引用数 14
ひとこと要約

本論文は、独創的なランクベースの条件付き逆強化学習(RC-IRL)アルゴリズムを用いた、データ駆動型の自動チューニングフレームワークを、レベル4自動運転車両の運動計画アルゴリズムに提案する。このフレームワークは、エキスパートドライブデータを用いたオフライン学習と自動ラベリングにより、安全で効率的かつ自動的に報酬関数をチューニング可能であり、シミュレーションおよび実世界のテストにおいて25,000マイル以上にわたる走行で100%衝突なしの性能と優れた軌道の滑らかさを達成した。

ABSTRACT

Many autonomous driving motion planners generate trajectories by optimizing a reward/cost functional. Designing and tuning a high-performance reward/cost functional for Level-4 autonomous driving vehicles with exposure to different driving conditions is challenging. Traditionally, reward/cost functional tuning involves substantial human effort and time spent on both simulations and road tests. As the scenario becomes more complicated, tuning to improve the motion planner performance becomes increasingly difficult. To systematically solve this issue, we develop a data-driven auto-tuning framework based on the Apollo autonomous driving framework. The framework includes a novel rank-based conditional inverse reinforcement learning algorithm, an offline training strategy and an automatic method of collecting and labeling data. Our auto-tuning framework has the following advantages that make it suitable for tuning an autonomous driving motion planner. First, compared to that of most inverse reinforcement learning algorithms, our algorithm training is efficient and capable of being applied to different scenarios. Second, the offline training strategy offers a safe way to adjust the parameters before public road testing. Third, the expert driving data and information about the surrounding environment are collected and automatically labeled, which considerably reduces the manual effort. Finally, the motion planner tuned by the framework is examined via both simulation and public road testing and is shown to achieve good performance.

研究の動機と目的

  • 多様な走行シナリオにおける自動運転車両の運動計画アルゴリズムの報酬/コスト関数を手動でチューニングする課題に対処すること。
  • エキスパートドライブデータを用いた安全でオフラインの学習を可能にすることで、トレーニングにおける人的作業とリスクを低減すること。
  • 自動的なデータ収集とラベリングにより、複雑でレアケース(ロングテール)の走行シナリオにおける一般化性と性能を向上させること。
  • アポロ自動運転プラットフォームと互換性を持つスケーラブルでエンドツーエンドのフレームワークを開発すること。
  • シミュレーションおよび広範な実道路走行テストを通じて、フレームワークの有効性を検証すること。

提案手法

  • フレームワークは、エキスパートのデモンストレーションから報酬関数を学習するための独創的なランクベースの条件付き逆強化学習(RC-IRL)アルゴリズムを採用している。
  • エキスパート軌道と生成された軌道を比較するためのシアンサイト(Siamese)ニューラルネットワークアーキテクチャを用い、エキスパート行動に類似する度合いに基づいて順位付けを学習する。
  • 時間割引報酬関数を、時間ステップ間で共有パラメータを持つようにモデル化することで、軌道評価の一貫性を維持する。
  • 環境の文脈とエゴ車両の状態特徴を用いて、自動的に走行データを収集およびラベリングすることで、人的なアノテーション作業を削減する。
  • 安全性のリスクを避けるために、7億1800万フレームおよび28億個のサンプル軌道からなるフィルタリング済みデータセットを用いて、オフライン学習を実施する。
  • 確率的勾配降下法にADAMまたはRMSPropを用いて報酬関数を最適化し、約2エポックで収束する。

実験結果

リサーチクエスチョン

  • RQ1データ駆動型の自動チューニングフレームワークは、自動運転車両の運動計画アルゴリズムにおける報酬関数チューニングの人的作業と時間を削減できるか?
  • RQ2提案されたランクベースの条件付きIRL手法は、標準的なGANベースの手法と比較して、効果的な報酬関数を学習する上で優れているか?
  • RQ3フレームワークは、複雑でレアケースの走行シナリオを含む多様な走行状況において、安全性や滑らかさを損なわず一般化可能か?
  • RQ4自動ラベリングされたデータを用いたオフライン学習は、オンラインまたは人的チューニングと比較して、性能をどの程度維持できるか?
  • RQ5本フレームワークでチューニングされた運動計画アルゴリズムの実世界での性能は、安全性および軌道品質の観点でどの程度か?

主な発見

  • 自動チューニングフレームワークでチューニングされた運動計画アルゴリズムは、3,400件以上のテストケースにおいてシミュレーションで100%衝突なしの性能を達成した。
  • シアンサイトベースのRC-IRL手法は、縦方向加速度制約(|a_station| < 4.0)に99.33%の適合率を示し、GANベースラインの86.80%を上回った。
  • 時間方向のジャージャー制約(|j_station| < 6.0)に97.77%の適合率を示し、GAN手法の71.20%を上回った。
  • チューニングされた報酬関数は公道で検証され、2018年4月2日以降に25,000マイル以上の実世界走行において、頑健な性能を示した。
  • シアンサイトネットワークが学習した時間割引要因は、GANベース手法と比較してエキスパート行動との分布的整合性が優れていた。
  • オフライン学習戦略により、トレーニング中にリアルタイムフィードバックを必要とせず、システムの安全性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。