Skip to main content
QUICK REVIEW

[論文レビュー] Safe Deep Q-Network for Autonomous Vehicles at Unsignalized Intersection

Kasra Mokhtari, Alan R. Wagner|arXiv (Cornell University)|Jun 8, 2021
Autonomous Vehicle Technology and Safety参考文献 22被引用数 4
ひとこと要約

本論文は、ノイズの多い観測下でも歩行者の動きを推定し、周囲環境状態を把握する2つの長短期記憶(LSTM)ネットワークを用いて、信号のない交差点を歩行者と共同で走行する自律走行車両の安全な深層強化学習(DRL)フレームワークを提案する。将来の衝突予測モジュールが危険な行動をマスクすることで、トレーニングおよび未知の交差点形状の両方で0%の衝突を達成した。CARLAシミュレーションにおいても、合理的な速度と高い効率性を維持した。

ABSTRACT

We propose a safe DRL approach for autonomous vehicle (AV) navigation through crowds of pedestrians while making a left turn at an unsignalized intersection. Our method uses two long-short term memory (LSTM) models that are trained to generate the perceived state of the environment and the future trajectories of pedestrians given noisy observations of their movement. A future collision prediction algorithm based on the future trajectories of the ego vehicle and pedestrians is used to mask unsafe actions if the system predicts a collision. The performance of our approach is evaluated in two experiments using the high-fidelity CARLA simulation environment. The first experiment tests the performance of our method at intersections that are similar to the training intersection and the second experiment tests our method at intersections with a different topology. For both experiments, our methods do not result in a collision with a pedestrian while still navigating the intersection at a reasonable speed.

研究の動機と目的

  • 信号のない交差点で混雑し、歩行者の行動が予測不能な状況下での自律走行車両の安全な強化学習手法の開発。
  • 実世界の自律走行状況におけるノイズの多い不完全なセンサ観測の課題に対処すること。
  • 衝突のない走行を確保しつつ、合理的な速度とタスク完了率を維持すること。
  • 1つの配置構成でトレーニングした後、異なる交差点形状への一般化能力の評価。
  • 性能やリアルタイム実行可能性を損なわずに、深層強化学習に安全制約を統合すること。

提案手法

  • ノイズのある観測から、環境の認識状態と歩行者の将来の軌道を推定する2つの長短期記憶(LSTM)ネットワークをトレーニングする。
  • 将来の衝突予測アルゴリズムが、予測された軌道を用いて自車両と歩行者の間の潜在的衝突を評価する。
  • システムが将来の衝突を予測した場合、DRLポリシーで危険な行動がマスクされ、探索および実稼働時の安全性が保証される。
  • トレーニングの安定性とサンプル効率性を向上させるために、優先順位付き経験再生(PER)を用いた二重深層Qネットワーク(DDQN)をDRLエージェントが使用する。
  • 安全で適切なタイミングでの走行を促進し、衝突や著しい遅延に対してペナルティを与える条件付き報酬関数を設計する。
  • 本フレームワークは、現実的なセンサノイズと多様な交差点形状を想定した、高精細なCARLAシミュレーション環境で評価された。

実験結果

リサーチクエスチョン

  • RQ1DRLベースの制御ポリシーは、混雑した歩行者付きの信号のない交差点での自律走行において、0%の衝突を達成できるか?
  • RQ2LSTMベースの認識と将来の衝突検出を統合することで、標準的なDRLと比較して、ノイズのある観測下での安全性がどの程度向上するか?
  • RQ31つの交差点形状でトレーニングしたポリシーが、異なる未確認の交差点レイアウトにどの程度一般化できるか?
  • RQ4提案手法の安全なDRL手法は、ルールベースのベースラインと比較して、衝突率、速度、走行効率の面でどの程度優れているか?
  • RQ5信念更新用LSTMは、リアルタイム意思決定におけるセンサノイズへのロバストネスを向上させる役割を果たすか?

主な発見

  • 提案された安全なDRL手法は、両方の実験で0%の衝突エピソードを達成し、ルールベースのベースラインおよび標準DRLエージェントを上回った。
  • SRLエージェントは、実験1で28.12秒、実験2で28.61秒で走行を完了し、平均速度はそれぞれ3.25m/sおよび3.27m/sであった。
  • SRLエージェントは、最近接歩行者との平均距離を7.19mおよび7.21mに維持しており、より安全な相互作用行動を示した。
  • 将来の衝突検出モジュールおよびSRLエージェントは0%の衝突を達成したが、標準RLエージェントはノイズ観測の影響で6%の衝突率を示した。
  • 信念更新用LSTMは、認識ノイズに対するロバストネスを著しく向上させた。純粋なRLエージェント(このモジュールなし)は6%の衝突率を示したのに対し、SRLバージョンでは0%であった。
  • 本手法は、異なる交差点形状間で良好な一般化を示し、トレーニング環境および未知の環境の両方で一貫した性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。