Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning Based High-level Driving Behavior Decision-making Model in Heterogeneous Traffic

Zhengwei Bai, Baigen Cai|arXiv (Cornell University)|Feb 15, 2019
Autonomous Vehicle Technology and Safety参考文献 13被引用数 10
ひとこと要約

本稿では、混在交通状況におけるコネクテッドビークルのための高水準なドライブ行動意思決定モデルを、ハイパーグリッドマトリクス(HGM)を用いてV2Xデータを統一し、Dueling DQNを搭載した二重ストリームのパラメータ共有DNNを用いて最適ポリシーを学習する深層強化学習(DRL)ベースの手法として提案する。本モデルは、訓練速度の向上、不要な車線変更の減少、および異なるコネクテッドビークル比率における優れた一般化性能を達成しており、ベースライン手法に比べて速度と効率性において優れている。

ABSTRACT

High-level driving behavior decision-making is an open-challenging problem for connected vehicle technology, especially in heterogeneous traffic scenarios. In this paper, a deep reinforcement learning based high-level driving behavior decision-making approach is proposed for connected vehicle in heterogeneous traffic situations. The model is composed of three main parts: a data preprocessor that maps hybrid data into a data format called hyper-grid matrix, a two-stream deep neural network that extracts the hidden features, and a deep reinforcement learning network that learns the optimal policy. Moreover, a simulation environment, which includes different heterogeneous traffic scenarios, is built to train and test the proposed method. The results demonstrate that the model has the capability to learn the optimal high-level driving policy such as driving fast through heterogeneous traffic without unnecessary lane changes. Furthermore, two separate models are used to compare with the proposed model, and the performances are analyzed in detail.

研究の動機と目的

  • 混在交通状況におけるコネクテッドビークルと人間運転車両が混在する環境における高水準なドライブ意思決定の課題に対処すること。
  • 非コネクテッド車両の行動が一様であると仮定する既存のモデルの限界を克服すること。
  • 統一されたデータフォーマットを介して生のV2Xデータとニューラルネットワークを分離することで、モデルの一般化性能とロバスト性を向上させること。
  • エンドツーエンドの訓練を通じて、不要な車線変更を伴わない高速で安定したドライブを実現する最適ポリシーを学習するDRLフレームワークの構築。
  • 異なる比率のコネクテッドビークル(CAV)と人間運転車両(HV)を想定した環境において、モデルの性能と一般化能力を検証すること。

提案手法

  • モデルは、生のV2Xデータを統一的かつ構造化されたフォーマットに変換するためのハイパーグリッドマトリクス(HGM)を用い、入力表現とニューラルネットワークの分離を実現する。
  • 二重ストリームでパラメータを共有する深層ニューラルネットワークが、HGMからの空間的および時間的特徴を処理し、異種のデータの効果的な統合を可能にする。
  • ポリシーネットワークは、状態行動価値を推定するためにDueling DQNアーキテクチャを採用しており、価値関数の近似とポリシー学習の両方を改善する。
  • DRLエージェントは、100万ステップにわたりεを1から0.1に線形に減少させるε-greedy探索戦略を用いて訓練される。
  • CAV、AHV(自律的運転人間運転車両)、CHV(コネクテッド人間運転車両)の比率が異なる5つの異種交通シナリオを含む、独自のシミュレーション環境を構築した。
  • モデルは、エージェントが環境を観測し、加速や車線変更などの行動をとった後、速度、安全性、効率性に基づく高密度報酬を受けるクローズドループシミュレーションで訓練およびテストされる。

実験結果

リサーチクエスチョン

  • RQ1DRLベースのモデルは、不要な車線変更を伴わず、高速で安全かつ効率的な走行を実現する最適な高水準ドライブポリシーを、混在交通状況で学習できるか?
  • RQ2提案されたHGMデータマッピング技術は、生のV2Xデータを直接使用する場合と比較して、モデルの一般化性能をどのように向上させるか?
  • RQ3二重ストリームでパラメータを共有するDNNは、複雑な交通状況におけるハイブリッドV2X入力からの特徴抽出をどのように強化するか?
  • RQ4異なるCAV比率において、提案モデルの性能(速度、車線変更、追い越し行動)は、既存手法(例:Minの手法、Coordinate手法)と比較してどのように差がつくか?
  • RQ5本モデルは、多様な異種交通構成においても、安定した性能と一般化能力を維持できるか?

主な発見

  • 提案モデルは、シナリオ4(75% CAV)で平均速度1974 km/hを達成し、Minの手法(1907 km/h)およびCoordinate手法(1875 km/h)を大きく上回った。
  • ベースラインと比較して、平均的な車線変更回数をより効果的に削減し、全テストシナリオで最低水準の値を記録しており、ポリシー効率性の優位性が示された。
  • シナリオ5(100% CAV)では、1969 km/hの高い性能を達成し、完全にコネクテッドな環境下でも優れた性能を示した。
  • HGMを回避するCoordinate手法は、性能低下を示した(例:シナリオ3で1867 km/h)。これは、HGMがモデルの一般化性能を向上させる上で極めて重要な役割を果たしていることを確認した。
  • 提案モデルは、追い越し行動の変動が小さく安定した訓練を示したのに対し、Minの手法は訓練中に高いばらつきを示した。
  • 本モデルは全5つのテストシナリオにおいて良好な一般化を示し、CAV比率にかかわらず高い性能を維持した。一方、Minの手法はシナリオ間でほぼ同一の結果を示し、適応性の低さが顕在した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。