Skip to main content
QUICK REVIEW

[論文レビュー] Safe Trajectory Planning Using Reinforcement Learning for Self Driving

Josiah Coad, Zhiqian Qiao|arXiv (Cornell University)|Nov 9, 2020
Autonomous Vehicle Technology and Safety参考文献 26被引用数 5
ひとこと要約

この論文は、自己走行車の軌道計画におけるモデルフリー強化学習(RL)手法を提案し、制御を直接行うのではなく運動計画を分離することで、安全性と快適性を向上させている。連続的アクション空間で滑らかで安全な軌道を生成するようにRLエージェントを訓練する一方、安全制約を後処理フィルタによって強制することで、離散的探索やエンドツーエンド制御手法と比較して、推論が高速化され、ジャerkが低減し、衝突リスクも低下する。

ABSTRACT

Self-driving vehicles must be able to act intelligently in diverse and difficult environments, marked by high-dimensional state spaces, a myriad of optimization objectives and complex behaviors. Traditionally, classical optimization and search techniques have been applied to the problem of self-driving; but they do not fully address operations in environments with high-dimensional states and complex behaviors. Recently, imitation learning has been proposed for the task of self-driving; but it is labor-intensive to obtain enough training data. Reinforcement learning has been proposed as a way to directly control the car, but this has safety and comfort concerns. We propose using model-free reinforcement learning for the trajectory planning stage of self-driving and show that this approach allows us to operate the car in a more safe, general and comfortable manner, required for the task of self driving.

研究の動機と目的

  • 離散的探索と数値最適化に依存する古典的手法の限界に対処する。これらは計算コストが高く、滑らかさに欠ける。
  • エンドツーエンドRL制御における安全性と解釈可能性の問題を克服するため、軌道計画と低レベル制御を分離する。
  • 微分可能で連続的アクションを持つRLポリシーを用いて、高次元かつ複雑なドライブ環境でも、より安全で快適で高速な軌道生成を実現する。
  • 安全制約をRLパイプラインに統合するため、制御実行前に不適切な軌道をフィルタリングする。これにより、物理的および運用的制限を遵守する。
  • RLベースの計画が、包括的な離散的探索とエンドツーエンド制御の両方を上回ることを実証する。評価指標は軌道の滑らかさ、計算効率、安全性である。

提案手法

  • モデルフリーの深層強化学習エージェント(PPO)を用い、周囲の状況入力(占有グリッドと速度制限)を条件として、連続的アクション空間で全軌道を計画する。
  • 軌道計画と直接制御の分離:RLポリシーは軌道を出力し、別個のPIDコントローラーがその軌道を追跡する。
  • 安全制約モジュール(アルゴリズム1)を適用し、道路外走行、衝突、過度の曲率や加速度といった安全ルールに違反する軌道を拒否する。
  • 軌道の道路外逸脱、高曲率、過度の加速度/ジャerk、余分な距離をペナルティとする密集型で形状化された報酬関数を用いて、RLポリシーを訓練する。
  • 方策および価値ネットワークに、64-64ユニットの全結合ニューラルネットワークを用い、標準的なハイパーパrameterを用いてProximal Policy Optimization(PPO)で訓練する。
  • オフポリシーのデータ収集とカリキュラム学習を活用し、シミュレーション内でのサンプル効率と訓練安定性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1モデルフリー強化学習を、安全性と快適性を維持したまま、自己走行車の軌道計画に効果的に適用できるか?
  • RQ2計算速度と軌道の滑らかさの観点で、RLベースの軌道計画は包括的離散探索に比べてどのように異なるか?
  • RQ3RLによって生成された軌道に対して、ポリシー性能を損なわせることなく、安全制約を効果的に適用できるか?
  • RQ4エンドツーエンド制御手法と比較して、RLベースの計画はジャerkを低減し、快適性を向上させられるか?
  • RQ5障害物の配置や速度制限が異なる多様なドライブシナリオにおいて、RLポリシーは再トレーニングなしで一般化できるか?

主な発見

  • 1000エピソードにわたる比較で、RLベースのプランナは包括的探索に比べて平均速度追従誤差を29%低減(5.306 ± 0.126 vs. 7.582 ± 0.195)。
  • RLポリシーは最大ジャerkを52%低減(0.194 ± 0.005 vs. 0.407 ± 0.012)し、最大曲率を59%低減(0.304 ± 0.010 vs. 0.738 ± 0.026)した。これは、著しく滑らかな軌道であることを示している。
  • 推論時間に10倍の高速化を達成(8.7×10⁻⁴ s vs. 7.9×10⁻³ s)、リアルタイム実装に適している。
  • 安全制約機構は、静的環境において100%の成功率で全衝突を防止した。たとえ初期に不適切な経路を提案しても同様であった。
  • RLポリシーは余分な距離を43%低減(0.185 ± 0.007 vs. 0.317 ± 0.011)し、最大向心加速度を16%低減(1.147 ± 0.036 vs. 1.367 ± 0.058)した。安全性と快適性の両方が向上した。
  • 再トレーニングなしで、静的障害物と変動する速度制限を伴う複数車線道路など、多様なシナリオにおいても良好な一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。