Skip to main content
QUICK REVIEW

[論文レビュー] Behavioral decision-making for urban autonomous driving in the presence of pedestrians using Deep Recurrent Q-Network

Niranjan Deshpande, Dominique Vaufreydaz|arXiv (Cornell University)|Oct 26, 2020
Autonomous Vehicle Technology and Safety参考文献 25被引用数 22
ひとこと要約

本稿では、歩行者を伴う都市部の自律走行における高レベルの行動意思決定のため、3次元状態表現と報酬関数を用いてシミュレートされた都市環境でエージェントを訓練する深層再帰的Qネットワーク(DRQN)を提案する。DRQNは、安全性和移動距離の観点でルールベース手法を上回り、衝突のないエピソードが70%に達する一方で、歩行者の行動を慎重に予測するため、平均速度が低くなるという代償がある。

ABSTRACT

Decision making for autonomous driving in urban environments is challenging due to the complexity of the road structure and the uncertainty in the behavior of diverse road users. Traditional methods consist of manually designed rules as the driving policy, which require expert domain knowledge, are difficult to generalize and might give sub-optimal results as the environment gets complex. Whereas, using reinforcement learning, optimal driving policy could be learned and improved automatically through several interactions with the environment. However, current research in the field of reinforcement learning for autonomous driving is mainly focused on highway setup with little to no emphasis on urban environments. In this work, a deep reinforcement learning based decision-making approach for high-level driving behavior is proposed for urban environments in the presence of pedestrians. For this, the use of Deep Recurrent Q-Network (DRQN) is explored, a method combining state-of-the art Deep Q-Network (DQN) with a long term short term memory (LSTM) layer helping the agent gain a memory of the environment. A 3-D state representation is designed as the input combined with a well defined reward function to train the agent for learning an appropriate behavior policy in a real-world like urban simulator. The proposed method is evaluated for dense urban scenarios and compared with a rule-based approach and results show that the proposed DRQN based driving behavior decision maker outperforms the rule-based approach.

研究の動機と目的

  • 予測不可能な歩行者行動を伴う複雑な都市環境における高レベルの行動意思決定の課題に対処すること。
  • 専門知識を必要とし、動的な都市環境において柔軟性に欠けるルールベースシステムの限界を克服すること。
  • 現実的な都市シミュレータとの相互作用を通じて最適な運転ポリシーを学習できる深層強化学習エージェントの開発。
  • LSTMを統合したDQN(DRQN)を用いて、歩行者の行動を予測する意思決定に長期記憶を統合すること。
  • 信号のない交差点や多様な歩行者行動を伴う密集した都市シナリオでの手法の評価。

提案手法

  • 深層再帰的Qネットワーク(DRQN)を用い、深層Qネットワーク(DQN)に長期間記憶を提供するための長短期記憶(LSTM)層を組み合わせ、意思決定に時間的記憶を付与する。
  • 幾何学的および意味的情報を環境から符号化するためのマルチチャネル3次元状態表現を設計し、車両および歩行者の位置・速度、道路構造を含む。
  • 安全なナビゲーション、目的地への進行を奨励し、衝突や過度なブレーキングをペナルティとする報酬関数を定義。
  • CARLAベースの都市シミュレータでエージェントを訓練し、現実的な歩行者行動を再現:60%が合法的横断、20%が違法な横断、20%が歩道歩行。
  • 低レベルの制御にはPIDコントローラーを用い、エージェントがこのコントローラーのダイナミクスをポリシー学習に組み込むように訓練。
  • 200エピソードにわたり訓練を実施し、1エピソードあたり最大1000ステップ。衝突が発生した場合や目的に到達した場合、早期終了する。

実験結果

リサーチクエスチョン

  • RQ1DRQNベースのエージェントは、歩行者を伴う密集した都市環境において、ルールベース手法よりも安全で効果的な行動ポリシーを学習できるか?
  • RQ2DQNアーキテクチャに長期間記憶(LSTM)を統合することで、不確実な歩行者行動を伴う動的都市シナリオでの意思決定がどのように向上するか?
  • RQ3マルチチャネル3次元状態表現は、エージェントの複雑な都市交通状況への認識および反応能力をどの程度向上させるか?
  • RQ4衝突回避性および移動効率の観点で、エージェントのパフォーマンスは、保守的であるとされるルールベースベースラインと比べてどうか?
  • RQ5エージェントは、歩行者密度や行動が変動する現実的な都市交通パターンに一般化できるか?

主な発見

  • DRQNベースのエージェントは70%の衝突のないエピソードを達成し、ルールベース手法の40%を大きく上回った。
  • DRQNエージェントは1エピソードあたり平均123.1メートルを衝突なしで走行したのに対し、ルールベースエージェントは82.6メートルにとどまり、経路効率の観点で優れていた。
  • ルールベースエージェントは平均速度7.79 km/hを記録した一方、DRQNエージェントは6.09 km/hであった。これは、後者による記憶を活用した慎重な予測行動によるものである。
  • 訓練のダイナミクスは、初期に衝突による報酬とステップ数の低下を示し、その後エージェントが衝突を避けるよう学習することで改善が見られた。
  • DRQNの記憶機能により、歩行者の動きを予測し、潜在的な衝突の前に滑らかで安全な減速が可能になった。
  • 結果から、記憶拡張型の深層強化学習は複雑な都市意思決定に有効であると示唆されるが、さらなる訓練と高度なアルゴリズムの導入によりパフォーマンスは向上可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。