Skip to main content
QUICK REVIEW

[論文レビュー] Automated Driving Maneuvers under Interactive Environment based on Deep Reinforcement Learning

Pin Wang, Ching‐Yao Chan|arXiv (Cornell University)|Mar 25, 2018
Autonomous Vehicle Technology and Safety参考文献 12被引用数 12
ひとこと要約

本論文は、インタラクティブなドライブ環境における安全で快適かつ効率的な車線変更行動を学習するため、連続的アクションを扱うQ関数近似器を備えた深層Q学習フレームワークを提案する。車両の運動学的知識を統合し、アクタ・クリティック構造を避けることで、安定した学習と向上したドライブパフォーマンスを達成しており、シミュレーションにおける収束する報酬と滑らかな制御軌跡によって示されている。

ABSTRACT

Safe and efficient autonomous driving maneuvers in an interactive and complex environment can be considerably challenging due to the unpredictable actions of other surrounding agents that may be cooperative or adversarial in their interactions with the ego vehicle. One of the state-of-the-art approaches is to apply Reinforcement Learning (RL) to learn a time-sequential driving policy, to execute proper control strategy or tracking trajectory in dynamic situations. However, direct application of RL algorithms is not satisfactorily enough to deal with the cases in the autonomous driving domain, mainly due to the complex driving environment and continuous action space. In this paper, we adopt Q-learning as our basic learning framework and design a unique format of the Q-function approximator that consists of neural networks to handle the continuous action space challenge. The learning model is present in a closed form of continuous control variables and trained in a simulation platform that we have developed with embedded properties of real-time vehicle interactions. The proposed algorithm avoids invoking an additional actor network that learns to take actions, as in actor-critic algorithms. At the same time, some prior knowledge of vehicle dynamics is also fed into the model to assist learning. We test our algorithm with a challenging use case - lane change maneuver, to verify the practicability and feasibility of the proposed approach. Results from accumulated rewards and vehicle performance show that RL vehicle agents successfully learn a safe, comfort and efficient driving policy as defined in the reward function.

研究の動機と目的

  • 複雑でインタラクティブなドライブ環境における連続的状態空間とアクション空間を扱える強化学習フレームワークの開発を目的とする。
  • 連続的制御のための閉形式Q関数近似器を用いることで、アクタ・クリティックネットワークの複雑さを回避する。
  • 車両の運動学的知識を統合することで、方策学習の加速と安定化を図る。
  • 高精細なシミュレーション環境で挑戦的な車線変更行動を用いて、手法の妥当性を検証する。
  • 報酬ベースの学習によって、エージェントが安全で快適かつ効率的なドライブ方策を学習することを示す。

提案手法

  • 連続的アクションをモデル化するため、正規化されたアドバンテージ関数を用いた二次形式のQ関数近似器を採用する。
  • Q関数を閉形式で設計することで、別個のアクタネットワークの必要性を排除し、モデルの複雑さを低減する。
  • Q関数に車両の運動学的知識を統合することで、サンプル効率性と学習安定性を向上させる。
  • リアルタイムの車両相互作用と動的交通シナリオを再現するカスタムシミュレーションプラットフォームでモデルを訓練する。
  • 安全でない接近(近接)、不快(高加速度)、非効率(長時間の行動)に対するペナルティを課す報酬関数を採用する。
  • 経験リプレイとターゲットネットワーク技術を用いて学習を安定化させ、損失関数と報酬曲線の収束を監視する。

実験結果

リサーチクエスチョン

  • RQ1連続的状態空間とアクション空間を有する動的でインタラクティブな交通環境において、深層Q学習エージェントは安全で効率的な車線変更方策を学習できるか?
  • RQ2車両の運動学的知識を統合することで、方策の学習速度と安定性はどのように変化するか?
  • RQ3提案された閉形式Q関数近似器は、自律走行の連続的制御において、アクタ・クリティックまたは離散的アクションアプローチを上回る性能を示すか?
  • RQ4報酬と制御の滑らかさという指標で測定した場合、トレーニングを経てエージェントのドライブ行動はどの程度向上するか?
  • RQ5複数のテスト車両にわたる一般化が可能であるか、すなわち方策のロバスト性と転送性はどの程度確保できるか?

主な発見

  • 学習損失曲線が明確に収束しており、予測されたQ値が時間経過とともにターゲット値に非常に近づいていることが示されている。
  • 個々の車両の総報酬は着実に増加し、高い水準に安定しており、ペナルティの最小化におけるパフォーマンス向上が示されている。
  • 100台のテスト車両ごとの平均総報酬は、トレーニングステップに伴い一貫して上昇しており、方策の改善が確認されている。
  • 最終モデル(400,000ステップ)のヨー加速度およびヨー回転速度曲線は、初期モデル(40,000ステップ)と比較して滑らかでより穏やかな変化を示しており、ドライブの快適性の向上が裏付けられている。
  • 車両エージェントは、報酬関数で定義された安全・快適・効率のバランスを取る方策を成功裏に学習している。
  • 追加のアクタネットワークの必要性を回避することで、トレーニングの複雑さを低減しつつ、安定的かつ効果的な方策学習が達成されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。