Skip to main content
QUICK REVIEW

[論文レビュー] PDLight: A Deep Reinforcement Learning Traffic Light Control Algorithm with Pressure and Dynamic Light Duration

Chenguang Zhao, Xiaorong Hu|arXiv (Cornell University)|Sep 29, 2020
Traffic control and management参考文献 21被引用数 5
ひとこと要約

PDLightは、到着車両の圧力と出庫レーンの残り容量を組み合わせた新規報酬関数PRCOL(出庫レーンの残余容量を伴う圧力)を用いる深層強化学習交通信号制御アルゴリズムを提案する。この報酬関数により、流入車両の圧力と出庫レーンの容量の両方を考慮して信号タイミングを最適化する。合成データおよび実世界データセットを用いた評価において、特に動的グリーン時間持続時間の条件下で、PressLight や Colight などの最先端手法と比較して平均移動時間を短縮し、ネットワークスループットを向上させた。

ABSTRACT

Existing ineffective and inflexible traffic light control at urban intersections can often lead to congestion in traffic flows and cause numerous problems, such as long delay and waste of energy. How to find the optimal signal timing strategy is a significant challenge in urban traffic management. In this paper, we propose PDlight, a deep reinforcement learning (DRL) traffic light control algorithm with a novel reward as PRCOL (Pressure with Remaining Capacity of Outgoing Lane). Serving as an improvement over the pressure used in traffic control algorithms, PRCOL considers not only the number of vehicles on the incoming lane but also the remaining capacity of the outgoing lane. Simulation results using both synthetic and real-world data-sets show that the proposed PDlight yields lower average travel time compared with several state-of-the-art algorithms, PressLight and Colight, under both fixed and dynamic green light duration.

研究の動機と目的

  • 固定または柔軟性に欠けるタイミングスケジュールに依存する既存の交通信号制御システムの限界を解決すること。
  • 報酬関数にレーン容量を組み込むことで、強化学習ベースの交通制御を改善すること。
  • リアルタイムの交通変動に効果的に対応できる動的で適応的な信号制御アルゴリズムを設計すること。
  • 都市交差点における車両遅延と混雑を低減するとともに、ネットワークスループットを向上させること。

提案手法

  • 本稿では、流入レーンの車両数と出庫レーンの残余容量を組み合わせた新しい圧力指標PRCOLを導入する。
  • PDLightは、各交差点ごとに深層Qネットワーク(DQN)エージェントを用い、リアルタイムの交通観測に基づいて最適な信号フェーズ行動を学習する。
  • 行動空間は、各交差点における事前に定義されたフェーズ設定の集合から次のグリーンフェーズを選択することから成る。
  • 報酬関数はPRCOLとして定義され、出庫レーンが満杯の状態で車両の列が発生するような行動に対してペナルティを与えることで、非効率なグリーン時間の使用を回避する。
  • 本アルゴリズムは、固定および動的グリーン時間持続時間の両方をサポートしており、後者は予測された車両スループットに基づいて調整される。
  • 合成および実世界のデータセット(杭州およびニューヨーク)を用いたシミュレーション実験により、さまざまな交通状況下での性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1報酬関数に出庫レーン容量を組み込むことで、交通信号制御のパフォーマンスはどのように向上するか?
  • RQ2PRCOLベースの報酬関数は、従来の圧力ベース手法と比較して、平均車両移動時間を短縮できるか?
  • RQ3動的グリーン時間持続時間は、強化学習ベースの交通制御のパフォーマンスにどのように影響するか?
  • RQ4PRCOLは、実世界の交通シナリオにおけるネットワークスループットと混雑緩和にどのような影響を及ぼすか?

主な発見

  • 先行研究によると、PDLightは固定時系列信号制御と比較して平均移動時間を最大73%短縮した。
  • 杭州データセットでは、動的グリーン時間持続時間下でPressLightと比較して平均移動時間を12.3%短縮し、Colightと比較して9.8%短縮した。
  • ニューヨークデータセットでは、動的持続時間下でColightと比較して平均移動時間を10.5%改善し、PressLightと比較して14.1%改善した。
  • 本アルゴリズムは、最多車両数のフェーズを選択する頻度が高く(杭州では0.518、ニューヨークでは0.549)、高需要フローの効果的な優先順位付けを示した。
  • 動的グリーン時間持続時間の適応性は、特に杭州データセットにおいて、高密度期にグリーン時間を延長する傾向が確認され、実際の交通需要と整合していた。
  • グリーン時間の延長に伴い、理想と実際の車両通過数の差が拡大する傾向が確認され、モデルが交通の不確実性を現実的かつ適切に扱っていることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。