Skip to main content
QUICK REVIEW

[論文レビュー] Expression might be enough: representing pressure and demand for reinforcement learning based traffic signal control

Liang Zhang, Qiang Wu|arXiv (Cornell University)|Dec 19, 2021
Traffic control and management被引用数 12
ひとこと要約

本稿では、圧力と走行中の車両を統合することで、圧力ベースの状態表現を改善する、Advanced-MPと呼ばれる新しい交通信号制御手法を提案する。この高度な交通状態(ATS)を強化学習と組み合わせ、Advanced-XLightテンプレートを用いることで、大規模都市ネットワークにおいて最先端の性能を達成し、多数の実世界データセットにおいて平均移動時間の低減で先行手法を上回る。

ABSTRACT

Many studies confirmed that a proper traffic state representation is more important than complex algorithms for the classical traffic signal control (TSC) problem. In this paper, we (1) present a novel, flexible and efficient method, namely advanced max pressure (Advanced-MP), taking both running and queuing vehicles into consideration to decide whether to change current signal phase; (2) inventively design the traffic movement representation with the efficient pressure and effective running vehicles from Advanced-MP, namely advanced traffic state (ATS); and (3) develop a reinforcement learning (RL) based algorithm template, called Advanced-XLight, by combining ATS with the latest RL approaches, and generate two RL algorithms, namely "Advanced-MPLight" and "Advanced-CoLight" from Advanced-XLight. Comprehensive experiments on multiple real-world datasets show that: (1) the Advanced-MP outperforms baseline methods, and it is also efficient and reliable for deployment; and (2) Advanced-MPLight and Advanced-CoLight can achieve the state-of-the-art.

研究の動機と目的

  • 既存の交通状態表現が走行中車両を無視しており、段階切り替えの柔軟性に欠けるという限界を解消すること。
  • 停止待ちの圧力と走行中車両からの需要を両方捉える、より表現力があり効率的な交通状態表現を開発すること。
  • 高度な状態表現を統合できる、柔軟でスケーラブルな強化学習ベースのフレームワークを設計すること。
  • 多様な都市交通ネットワークにわたる、提案手法の優れた性能と一般化能力を実証すること。

提案手法

  • 停止車両と走行中車両の両方を評価することで、最適な信号段階切り替えを決定する、柔軟な段階切り替え戦略である Advanced-MP を導入する。
  • 定義された観測範囲内での交通流動圧力と有効な走行中車両を組み合わせることで、高度な交通状態(ATS)を設計する。
  • ATS を任意のディープ強化学習アプローチと統合できる RL アルゴリズムフレームワークである Advanced-XLight テンプレートを提案する。これにより、新規アルゴリズムのモジュラー開発が可能になる。
  • 走行中車両のための動的観測範囲を採用し、有効範囲内(例:100m や 200m)の車両のみを対象とすることで、ノイズを低減し効率を向上させる。
  • 圧力と需要の信号を強化したグリーディ行動選択メカニズムを採用し、応答性を向上させ、不要な段階切り替えを削減する。
  • Advanced-XLight テンプレートを応用して、2つの具体的なアルゴリズム、Advanced-MPLight と Advanced-CoLight を生成する。これらは、深層Qネットワークと分散実行を伴う集中学習により訓練される。

実験結果

リサーチクエスチョン

  • RQ1停止圧力と走行中車両の需要を両方含む交通状態表現が、信号制御性能を顕著に向上させることができるか?
  • RQ2状態表現に有効な走行中車両を組み込むことで、強化学習ベースの交通信号制御器の一般化能力とロバストネスにどのような影響を与えるか?
  • RQ3Advanced-MP 法は、多様な交通状況において、従来の最大圧力法や作動制御戦略を上回る効率性と適応性を示すか?
  • RQ4Advanced-XLight フレームワークは、大規模都市交通ネットワークにおける移行性とスケーラビリティをどの程度実現できるか?

主な発見

  • Advanced-MP は、全テスト行動時間において、Efficient-CoLight を含む先行の最先端手法を上回り、優れた性能とロバストネスを示した。
  • Advanced-MPLight と Advanced-CoLight は、評価された全実世界データセットで、平均移動時間の最低削減を達成し、ATS 表現の有効性を確認した。
  • 走行中車両の有効観測範囲(例:100m や 200m)を用いた場合にモデル性能が最大に達するが、全走行中車両を観測範囲に含めると性能が低下するため、有効範囲の選定が極めて重要であることが示された。
  • Advanced-MPLight は優れた移行性を示し、上海と杭州のデータセットからニューヨーク市に移行した場合、直接学習した場合よりも優れた性能を発揮した。これは、過学習が少なく、一般化能力が高いことを示している。
  • 提案された ATS 表現は、圧力のみまたは単純な停止列車ベースの表現よりも、より意味のある交通ダイナミクスを捉えており、より効率的かつ応答性の高い信号制御を可能にした。
  • 包括的なアブレーションスタディにより、走行中車両の需要の組み込みがモデル性能を顕著に向上させることを確認し、本手法のコア設計原理を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。