Skip to main content
QUICK REVIEW

[論文レビュー] Feudal Multi-Agent Reinforcement Learning with Adaptive Network Partition for Traffic Signal Control

Jinming Ma, Feng Wu|arXiv (Cornell University)|May 27, 2022
Traffic control and management被引用数 6
ひとこと要約

本稿では、GNNとモンテカルロツリー探索(MCTS)を用いてリアルタイムの交通フローに応じて動的かつ適応的に交通ネットワークを分割する、適応的ネットワーク分割を備えたフェodalマルチエージェント強化学習フレームワークを提案する。この手法により、階層的なマネージャ-ワーカ-構造を通じてスケーラブルでフローに配慮した協調制御が可能となり、合成的および実都市ネットワークにおいて平均移動時間とキュー長を低減する点で最先端の手法を上回る性能を発揮する。

ABSTRACT

Multi-agent reinforcement learning (MARL) has been applied and shown great potential in multi-intersections traffic signal control, where multiple agents, one for each intersection, must cooperate together to optimize traffic flow. To encourage global cooperation, previous work partitions the traffic network into several regions and learns policies for agents in a feudal structure. However, static network partition fails to adapt to dynamic traffic flow, which will changes frequently over time. To address this, we propose a novel feudal MARL approach with adaptive network partition. Specifically, we first partition the network into several regions according to the traffic flow. To do this, we propose two approaches: one is directly to use graph neural network (GNN) to generate the network partition, and the other is to use Monte-Carlo tree search (MCTS) to find the best partition with criteria computed by GNN. Then, we design a variant of Qmix using GNN to handle various dimensions of input, given by the dynamic network partition. Finally, we use a feudal hierarchy to manage agents in each partition and promote global cooperation. By doing so, agents are able to adapt to the traffic flow as required in practice. We empirically evaluate our method both in a synthetic traffic grid and real-world traffic networks of three cities, widely used in the literature. Our experimental results confirm that our method can achieve better performance, in terms of average travel time and queue length, than several leading methods for traffic signal control.

研究の動機と目的

  • マルチエージェント強化学習を用いた交通信号制御における静的ネットワーク分割の限界、すなわち動的交通状況に適応できない点を是正すること。
  • フローに配慮した動的で適応的なネットワーク分割機構を導入することで、交通信号エージェント間のグローバルな協調を向上させること。
  • 変動する交通パターンやネットワークサイズに耐えうるスケーラブルで適応的な階層的MARLフレームワークを設計すること。
  • 実都市および合成交通環境において、GNNとMCTSを用いた適応的分割と静的・ベースライン分割手法を比較することで、適応的分割の有効性を評価すること。

提案手法

  • 交通ネットワークは動的フローグラフとしてモデル化され、ネットワーク分割の入力として交通フロー密度が使用される。
  • 2つの適応的分割手法を提案する:(1) フロー特徴からエンドツーエンドで領域割り当てを学習するGNNベースの手法、(2) GNNで算出された基準を用いて最適な分割を探索するMCTSベースの手法。
  • 動的分割による可変サイズの入力領域に対応できるQMIXの変種を設計し、柔軟な集中学習と分散実行を可能にする。
  • フェodal階層を採用し、各領域内のマネージャーエージェントがハイレベルな目標を調整し、交差点のローカルワーカーエージェントにサブゴールを通信する。
  • GNNによる特徴抽出とMCTSによる最適分割探索を統合することで、変化する交通パターンへのスケーラビリティと適応性を実現する。
  • 集中学習と分散推論を組み合わせたエンドツーエンドの学習により、スケーラビリティを維持しながらグローバルな協調性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1リアルタイムの交通フローに基づく適応的ネットワーク分割は、交通信号制御におけるマルチエージェント強化学習の性能を向上させ得るか?
  • RQ2GNNベースとMCTSベースの分割手法は、大規模都市ネットワークにおいて、分割品質とスケーラビリティの観点でどのように比較されるか?
  • RQ3動的分割と組み合わせたフェodal階層の統合は、より良いグローバルな協調性と短い平均移動時間をもたらすか?
  • RQ4本手法は、合成的および実都市交通ネットワークにおいて、静的分割手法および最先端のTSCベースラインと比較して、どのように性能を発揮するか?

主な発見

  • MCTSベースの適応的分割手法は、全探索に近い性能を示し、16×3グリッドで8.90秒の実行時間であったのに対し、全探索は41.96秒であった。これは高い効率性とスケーラビリティを示している。
  • MCTSベースの分割は高い領域内接続性と低い領域間フローを実現し、静的またはGNNベースの分割よりも優れた協調性と短い平均移動時間を達成した。
  • GNNベースの分割手法は動的フローに適応可能であったが、しばしば非連結な領域を生成し、分割品質が低いため性能が劣った。
  • 本手法は、すべてのテスト環境(3都市の実都市ネットワークも含む)において、平均移動時間とキュー長を顕著に低減し、最先端の手法を上回った。
  • 適応的分割を統合したフェodalMARLは、大規模ネットワークでも優れた性能を発揮し、動的交通パターンに対してスケーラビリティとロバストネスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。