Skip to main content
QUICK REVIEW

[論文レビュー] Reinforcement Learning Based Safe Decision Making for Highway Autonomous Driving

Arash Mohammadhasani, Hamed Mehrivash|arXiv (Cornell University)|May 13, 2021
Autonomous Vehicle Technology and Safety参考文献 29被引用数 6
ひとこと要約

本稿では、衝突回避を保証し、予測不可能なエージェントによる観測不能状態に対処できる、高速道路における自律走行のための深層強化学習(DRL)ベースの安全意思決定フレームワークを提案する。安全制約の適用と潜在的環境状態のモデル化により、学習が加速され、高精細シミュレーションにおいても高い性能を発揮し、マルチレーン交通状況において安全性と意思決定の質が向上していることが実証された。

ABSTRACT

In this paper, we develop a safe decision-making method for self-driving cars in a multi-lane, single-agent setting. The proposed approach utilizes deep reinforcement learning (RL) to achieve a high-level policy for safe tactical decision-making. We address two major challenges that arise solely in autonomous navigation. First, the proposed algorithm ensures that collisions never happen, and therefore accelerate the learning process. Second, the proposed algorithm takes into account the unobservable states in the environment. These states appear mainly due to the unpredictable behavior of other agents, such as cars, and pedestrians, and make the Markov Decision Process (MDP) problematic when dealing with autonomous navigation. Simulations from a well-known self-driving car simulator demonstrate the applicability of the proposed method

研究の動機と目的

  • マルチレーン高速道路環境における自律走行車両の安全で高水準の意思決定ポリシーの開発を目的とする。
  • 周囲のエージェントの予測不能な行動にもかかわらず、衝突のないナビゲーションを保証する課題に対処することを目的とする。
  • 不確実なエージェントダイナミクスによって引き起こされる観測不能な環境状態をモデル化・対処することを目的とする。
  • 安全制約を学習フレームワークに直接組み込むことで、複雑で高次元の意思決定タスクにおける強化学習プロセスの高速化を目的とする。
  • 本手法の有効性を現実的な高速道路走行シミュレーションで検証することを目的とする。

提案手法

  • 本手法は、マルチレーン高速道路シナリオにおける戦術的意思決定のための高水準ポリシーを学習するために深層強化学習を採用する。
  • 学習目的関数に安全制約を明示的に組み込み、トレーニング時およびデプロイ時においても衝突が発生しないことを保証する。
  • 強化学習フレームワーク内での潜在状態表現を用いて、周囲の車両の隠れた意図や行動といった観測不能状態をモデル化する。
  • 部分観測性を扱うために、安全意識のある関数近似を組み込んだマーカフ決定過程(MDP)定式化を採用する。
  • 性能評価を現実的な交通状況下で行うために、確立された自動運転車シミュレータを用いたシミュレーション環境でポリシーをトレーニングする。
  • サンプル効率と収束速度の向上を図るため、内生的報酬形状を与える手法をトレーニングプロセスに組み込む。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習は、自律走行の高速道路走行において、どのようにして衝突のない意思決定を保証できるか?
  • RQ2予測不能なエージェントからの観測不能状態は、強化学習フレームワーク内でどの程度効果的にモデル化できるか?
  • RQ3明示的な安全制約は、複雑で高次元の意思決定タスクにおける学習プロセスを加速できるか?
  • RQ4本手法は、高速道路シナリオにおける安全性と意思決定の質の面で、標準的なDRLアプローチと比べてどのように差をつけるか?
  • RQ5潜在状態モデリングの統合は、マルチエージェント交通環境における一般化性とロバストネスを向上させることができるか?

主な発見

  • 提案手法は、トレーニング時および推論時においてすべての衝突を防止し、すべてのシミュレーションシナリオで保証された安全性を示した。
  • 安全制約の統合により、制約なしのDRLベースラインと比較して、学習プロセスが顕著に高速化された。
  • 周囲のエージェントからの観測不能状態を効果的に処理し、動的交通状況下での意思決定のロバストネスが向上した。
  • シミュレーションの結果、標準的なDRLアプローチと比較して、意思決定の質が高く、より滑らかな軌道計画が達成された。
  • 多様な交通密度や予測不能なエージェント行動の下でも、フレームワークは安定した性能を維持した。
  • 高速道路走行タスクにおいて、安全性、収束速度、ポリシー安定性の面で、ベースラインDRLモデルを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。