Skip to main content
QUICK REVIEW

[論文レビュー] Decentralized Cooperative Lane Changing at Freeway Weaving Areas Using Multi-Agent Deep Reinforcement Learning

Yi Hou, Peter Gräf|arXiv (Cornell University)|Oct 5, 2021
Traffic control and management参考文献 24被引用数 7
ひとこと要約

本稿では、フリーウェイのウェービング領域における協調的車線変更を可能にする、プロキシマルポリシー最適化(PPO)を用いた分散型マルチエージェント強化学習(MADRL)フレームワークを提案する。各車両が局所的な学習を実施しつつもグローバル状態情報をアクセス可能にすることで、交通通過量、車両速度、燃料効率を向上させるとともに、ストップ回数と排出ガスを削減する。この手法は、あらゆる混雑度における人間運転の交通状況を上回る性能を発揮する。

ABSTRACT

Frequent lane changes during congestion at freeway bottlenecks such as merge and weaving areas further reduce roadway capacity. The emergence of deep reinforcement learning (RL) and connected and automated vehicle technology provides a possible solution to improve mobility and energy efficiency at freeway bottlenecks through cooperative lane changing. Deep RL is a collection of machine-learning methods that enables an agent to improve its performance by learning from the environment. In this study, a decentralized cooperative lane-changing controller was developed using proximal policy optimization by adopting a multi-agent deep RL paradigm. In the decentralized control strategy, policy learning and action reward are evaluated locally, with each agent (vehicle) getting access to global state information. Multi-agent deep RL requires lower computational resources and is more scalable than single-agent deep RL, making it a powerful tool for time-sensitive applications such as cooperative lane changing. The results of this study show that cooperative lane changing enabled by multi-agent deep RL yields superior performance to human drivers in term of traffic throughput, vehicle speed, number of stops per vehicle, vehicle fuel efficiency, and emissions. The trained RL policy is transferable and can be generalized to uncongested, moderately congested, and extremely congested traffic conditions.

研究の動機と目的

  • 交通容量と効率の低下を引き起こすフリーウェイの混雑地点における頻発する車線変更を是正すること。
  • コネクテッドおよび自動運転車両を用いて、スケーラブルでリアルタイムな制御ソリューションを開発すること。
  • ウェービング領域における交通通過量、燃料効率の向上およびストップ回数と排出ガスの削減を図ること。
  • 学習済みポリシーが、混雑状態が異なる多様な交通環境(混雑なし、中程度混雑、極度に混雑)に一般化できることを保証すること。
  • 単一エージェントRLと比較して、計算負荷を軽減しスケーラビリティを向上させる分散型フレームワークを設計すること。

提案手法

  • ポリシー学習にマルチエージェント深層強化学習(MADRL)とプロキシマルポリシー最適化(PPO)を採用する。
  • 各車両(エージェント)が局所的観測とグローバル状態情報に基づいて独立してポリシーを学習する分散型制御戦略を実装する。
  • 交通通過量、速度、燃料効率、ストップ頻度に基づいて個々の車両の報酬を定義し、協調的行動を促進する。
  • 集中型学習と分散型実行(CTDE)アプローチを採用し、学習時にはグローバル状態にアクセス可能だが、推論時には局所的意思決定を維持する。
  • 状態観測を車線変更行動にマッピングするため、深層ニューラルネットワークを用いてエンドツーエンドでポリシーを学習する。
  • 混雑なし、中程度混雑、極度に混雑といった多様な交通状況で学習することで、ポリシーの移植性を確保する。

実験結果

リサーチクエスチョン

  • RQ1分散型MADRLフレームワークは、フリーウェイのウェービング領域における協調的車線変更を効果的に調整できるか?
  • RQ2提案されたMADRLコントローラは、人間運転の交通状況と比較して、通過量や排出ガスといった主要なパフォーマンス指標でどのように差をつけるか?
  • RQ3訓練済みのRLポリシーは、混雑なし、中程度混雑、極度に混雑といった異なる交通状況にどの程度一般化できるか?
  • RQ4学習時にグローバル状態情報を利用することで、分散型エージェントのパフォーマンスが向上するか?
  • RQ5ボトルネック状況における協調的車線変更は、燃料効率と車両のストップ頻度にどのような影響を与えるか?

主な発見

  • 提案されたMADRLベースのコントローラは、人間運転の交通状況と比較して、交通通過量において顕著に優れている。全テスト混雑度において測定可能な改善が確認された。
  • RLコントローラ下では、人間運転時と比較して車両速度が向上し、滑らかな交通フローが実現している。
  • 1台あたりのストップ回数が著しく減少し、快適性の向上と燃料消費の低減に寄与した。
  • 調整された車線変更により滑らかな加速とストップアンドゴー行動の低減が実現したため、燃料効率が向上した。
  • 協調的車線変更によってより一貫した走行パターンが実現し、ストップ回数が減少したため、排出ガスが削減された。
  • 再訓練なしに、混雑なし、中程度混雑、極度に混雑といった多様な交通状況に、訓練済みポリシーが効果的に一般化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。