Skip to main content
QUICK REVIEW

[論文レビュー] Autonomous Driving using Safe Reinforcement Learning by Incorporating a Regret-based Human Lane-Changing Decision Model

Dong Chen, Longsheng Jiang|arXiv (Cornell University)|Oct 10, 2019
Autonomous Vehicle Technology and Safety参考文献 24被引用数 5
ひとこと要約

本稿では、報酬に基づく人間の車線変更意思決定モデルを学習プロセスに統合することで、自律走行車両向けの安全な強化学習フレームワークを提案する。行動経済学の原則を用いて人間ドライバーの行動を予測することで、安全監視者が不適切な行動を制約し、訓練中に衝突をゼロに抑えることが可能となり、標準のDDQNと比較して高い学習効率とポリシー性能を維持する。

ABSTRACT

It is expected that many human drivers will still prefer to drive themselves even if the self-driving technologies are ready. Therefore, human-driven vehicles and autonomous vehicles (AVs) will coexist in a mixed traffic for a long time. To enable AVs to safely and efficiently maneuver in this mixed traffic, it is critical that the AVs can understand how humans cope with risks and make driving-related decisions. On the other hand, the driving environment is highly dynamic and ever-changing, and it is thus difficult to enumerate all the scenarios and hard-code the controllers. To face up these challenges, in this work, we incorporate a human decision-making model in reinforcement learning to control AVs for safe and efficient operations. Specifically, we adapt regret theory to describe a human driver's lane-changing behavior, and fit the personalized models to individual drivers for predicting their lane-changing decisions. The predicted decisions are incorporated in the safety constraints for reinforcement learning in training and in implementation. We then use an extended version of double deep Q-network (DDQN) to train our AV controller within the safety set. By doing so, the amount of collisions in training is reduced to zero, while the training accuracy is not impinged.

研究の動機と目的

  • 人間運転車両が混在する交通環境において、安全かつ効率的な自律走行車両ポリシーの訓練に取り組むこと。
  • 予想される後悔や確率加重といった心理的要因を捉える regret 理論を用いて、人間ドライバーの車線変更行動をモデル化すること。
  • 予測された人間の意思決定を用いて、強化学習における危険な行動を制約する安全監視者を開発すること。
  • 訓練および実装段階で衝突のない状態を保証すること。

提案手法

  • 予想される後悔、確率加重、範囲効果といった心理的要因を組み込んだ、個人のドライバーの車線変更行動を予測する regret ベースの意思決定モデルを開発する。
  • 実際のドライビングデータを用いてモデルをパーソナライズし、抽象的なリスク用語を速度や距離といった物理的指標に変換する。
  • 拡張された二重深層Qネットワーク(DDQN)を用いて自律走行車両の意思決定ポリシーを学習させ、経験再生とターゲットネットワークを用いて安定性を確保する。
  • 安全監視者が人間意思決定モデルの予測を用いて行動を監視し、衝突のおそれがある行動を安全な代替行動に置き換える。
  • フレームワークは階層的構造を採用しており、強化学習エージェントが安全監視者が定義する制約付きの行動空間内で学習を行う。
  • シミュレーションは CARLA を用い、車両の運動はオイラー積分法で、報酬関数は安全、速度、快適性の重み付き項を含む。

実験結果

リサーチクエスチョン

  • RQ1自律走行車両のシナリオにおいて、行動経済学の原則、特に regret 理論を用いて、人間ドライバーの車線変更意思決定をどのように正確にモデル化できるか?
  • RQ2regret ベースの人間意思決定モデルは、強化学習に基づく自律走行車両制御の安全性と安定性をどの程度向上できるか?
  • RQ3予測された人間行動を用いる安全監視者は、学習性能を劣化させることなく、強化学習の訓練中に衝突を削減できるか?
  • RQ4人間行動モデルの統合は、学習済み強化学習ポリシーの収束性およびロバストネスにどのように影響を与えるか?

主な発見

  • SafeRLフレームワークは訓練中に衝突をゼロに達成したのに対し、従来のDDQN(ConvRL)ベースラインでは8.6%のエポックで衝突が発生した。
  • 安全制約による探索空間の縮小にもかかわらず、SafeRLはConvRLと同等の性能に到達したポリシーに収束しており、制約の有効な活用が示された。
  • SafeRLの学習曲線は滑らかで安定しており、収束後も性能の変動がなかった。これに対してConvRLは、残存する衝突の影響で収束後も大きな変動を示した。
  • 安全監視者は、regret ベースの人間意思決定モデルからの予測を活用して、危険な行動を効果的に防止し、衝突のない運用を実現した。
  • 提案手法は高い訓練効率とポリシー性能を維持しており、安全制約が学習の正確性や速度を妨げないことを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。