Skip to main content
QUICK REVIEW

[论文解读] Feudal Multi-Agent Reinforcement Learning with Adaptive Network Partition for Traffic Signal Control

Jinming Ma, Feng Wu|arXiv (Cornell University)|May 27, 2022
Traffic control and management被引用 6
一句话总结

本论文提出了一种基于自适应网络划分的封建多智能体强化学习框架,用于交通信号控制,利用图神经网络(GNN)和蒙特卡洛树搜索(MCTS)根据实时流量动态划分交通网络。该方法在合成与真实城市网络中均显著优于最先进方法,通过分层管理者-工作者结构实现可扩展的、面向流量的协调,有效降低了平均行程时间和队列长度。

ABSTRACT

Multi-agent reinforcement learning (MARL) has been applied and shown great potential in multi-intersections traffic signal control, where multiple agents, one for each intersection, must cooperate together to optimize traffic flow. To encourage global cooperation, previous work partitions the traffic network into several regions and learns policies for agents in a feudal structure. However, static network partition fails to adapt to dynamic traffic flow, which will changes frequently over time. To address this, we propose a novel feudal MARL approach with adaptive network partition. Specifically, we first partition the network into several regions according to the traffic flow. To do this, we propose two approaches: one is directly to use graph neural network (GNN) to generate the network partition, and the other is to use Monte-Carlo tree search (MCTS) to find the best partition with criteria computed by GNN. Then, we design a variant of Qmix using GNN to handle various dimensions of input, given by the dynamic network partition. Finally, we use a feudal hierarchy to manage agents in each partition and promote global cooperation. By doing so, agents are able to adapt to the traffic flow as required in practice. We empirically evaluate our method both in a synthetic traffic grid and real-world traffic networks of three cities, widely used in the literature. Our experimental results confirm that our method can achieve better performance, in terms of average travel time and queue length, than several leading methods for traffic signal control.

研究动机与目标

  • 为解决多智能体强化学习在交通信号控制中静态网络划分的局限性,该局限性无法适应动态交通状况。
  • 通过引入一种动态、面向流量的网络划分机制,改善交通信号智能体之间的全局协调。
  • 设计一种可扩展且自适应的分层MARL框架,确保在不同交通模式和网络规模下保持高性能。
  • 在真实世界与合成交通环境中,评估基于GNN和MCTS的自适应划分相对于静态划分和基线方法的有效性。

提出的方法

  • 将交通网络建模为动态流量图,以交通流量密度作为网络划分的输入。
  • 提出两种自适应划分方法:(1) 基于GNN的方法,端到端学习从流量特征中分配区域;(2) 基于MCTS的方法,利用GNN计算的准则搜索最优划分。
  • 设计一种QMIX变体,以处理由动态划分导致的可变大小区域输入,实现灵活的集中式训练与去中心化执行。
  • 采用封建层级结构,其中各区域的管理者智能体协调高层目标,并向交叉路口的本地工作者智能体传达子目标。
  • 框架集成GNN进行特征提取,MCTS用于最优划分搜索,实现对变化交通模式的可扩展性与适应性。
  • 系统采用端到端训练,集中式训练与去中心化推理相结合,在保持可扩展性的同时提升全局协调能力。

实验结果

研究问题

  • RQ1基于实时交通流量的自适应网络划分能否提升多智能体强化学习在交通信号控制中的性能?
  • RQ2在大型城市网络中,基于GNN与MCTS的划分方法在划分质量与可扩展性方面如何比较?
  • RQ3将封建层级结构与动态划分相结合,是否能带来更好的全局协调与更低的平均行程时间?
  • RQ4在合成与真实世界交通网络中,所提方法相较于静态划分与最先进交通信号控制基线方法表现如何?

主要发现

  • 基于MCTS的自适应划分方法在性能上最接近穷举搜索,16×3网格上的运行时间为8.90秒,相比穷举搜索的41.96秒,展现出高效率与可扩展性。
  • MCTS方法产生的区域内部连通性高、区域间流量低,从而带来更优的协调效果与更低的平均行程时间,优于静态划分与基于GNN的划分。
  • 基于GNN的划分方法虽能适应动态流量,但常产生非连通区域,导致因划分质量差而性能欠佳。
  • 所提方法在所有测试环境中,包括三个城市的现实世界网络,均显著优于最先进方法,在降低平均行程时间和队列长度方面表现优异。
  • 采用自适应划分的封建MARL在大规模网络中表现卓越,展现出良好的可扩展性与对动态交通模式的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。