Skip to main content
QUICK REVIEW

[论文解读] Multi-Agent Deep Reinforcement Learning for Large-scale Traffic Signal Control

Tianshu Chu, Jie Wang|arXiv (Cornell University)|Mar 11, 2019
Traffic control and management参考文献 18被引用 4
一句话总结

本文提出了一种用于大规模交通信号控制的去中心化多智能体优势行动者-评论家(MA2C)框架,通过邻居指纹提升可观测性,并利用空间折扣因子降低学习难度。在合成的摩纳哥交通网络和真实世界网络上评估,MA2C在最优性、鲁棒性和样本效率方面均优于独立A2C和Q-learning基线方法,实现了更低且更可持续的延迟,并提升了网络容量利用率。

ABSTRACT

Reinforcement learning (RL) is a promising data-driven approach for adaptive traffic signal control (ATSC) in complex urban traffic networks, and deep neural networks further enhance its learning power. However, centralized RL is infeasible for large-scale ATSC due to the extremely high dimension of the joint action space. Multi-agent RL (MARL) overcomes the scalability issue by distributing the global control to each local RL agent, but it introduces new challenges: now the environment becomes partially observable from the viewpoint of each local agent due to limited communication among agents. Most existing studies in MARL focus on designing efficient communication and coordination among traditional Q-learning agents. This paper presents, for the first time, a fully scalable and decentralized MARL algorithm for the state-of-the-art deep RL agent: advantage actor critic (A2C), within the context of ATSC. In particular, two methods are proposed to stabilize the learning procedure, by improving the observability and reducing the learning difficulty of each local agent. The proposed multi-agent A2C is compared against independent A2C and independent Q-learning algorithms, in both a large synthetic traffic grid and a large real-world traffic network of Monaco city, under simulated peak-hour traffic dynamics. Results demonstrate its optimality, robustness, and sample efficiency over other state-of-the-art decentralized MARL algorithms.

研究动机与目标

  • 为解决大规模自适应交通信号控制(ATSC)中多智能体强化学习(MARL)面临的可扩展性和部分可观测性挑战。
  • 基于最先进的优势行动者-评论家(A2C)框架,开发一种完全去中心化、可扩展且稳定的MARL算法,用于ATSC。
  • 在去中心化MARL设置中,提升本地智能体的可观测性并降低学习难度,其中智能体通信有限且对环境的观测不完整。
  • 在真实世界和合成交通网络中,基于现实的高峰时段动态,将所提方法与独立A2C和Q-learning基线方法进行对比评估。
  • 与现有去中心化MARL方法相比,证明在最优性、鲁棒性和样本效率方面具有更优性能。

提出的方法

  • 提出一种多智能体A2C(MA2C)算法,将独立A2C扩展至合作式MARL,实现对单个交叉口的去中心化控制。
  • 引入邻居指纹——对相邻交叉口状态的共享表示——以提升本地可观测性和协调能力。
  • 在奖励函数中引入空间折扣因子,以减轻时间信用分配问题,并降低本地智能体的学习难度。
  • 使用深度神经网络参数化A2C框架中的策略函数和价值函数,实现在高维状态-动作空间中的函数逼近。
  • 采用经验回放和自举采样以实现稳定训练,同时保持在线学习以减少方差。
  • 对状态和奖励信号进行归一化处理,以稳定训练,特别是在高密度交通场景下。

实验结果

研究问题

  • RQ1去中心化的多智能体A2C框架是否能在部分可观测条件下实现大规模交通信号控制中的稳定且可扩展的学习?
  • RQ2邻居指纹和空间折扣如何提升多智能体交通控制中的可观测性和学习效率?
  • RQ3所提出的MA2C算法是否在延迟减少、队列管理及网络容量利用率方面优于独立A2C和Q-learning基线方法?
  • RQ4在真实世界城市网络中,面对现实的时间变化、时变且随机的交通动态,MA2C框架的鲁棒性如何?
  • RQ5在实际部署中,当面对噪声或延迟的传感器测量时,该算法在多大程度上仍能保持性能?

主要发现

  • 在合成网络和摩纳哥交通网络中,MA2C相较于IA2C和IQL-DNN均实现了更快且更稳定的训练收敛。
  • 在摩纳哥网络中,MA2C将平均交叉口延迟降低至更低且更可持续的水平,优于IA2C和贪婪策略,尤其是在高峰拥堵之后。
  • MA2C使网络流量更接近宏观基本图的‘最佳区域’,在饱和状态下最大化网络容量利用率。
  • 该算法在最小化最大队列长度和行程延迟方面优于所有基线方法,展现出更优的最优性和鲁棒性。
  • 独立Q-learning和IQL-DNN未能收敛或表现可靠,而IA2C虽在中期训练中表现尚可,但表现出不稳定性。
  • 使用邻居指纹和空间折扣显著增强了学习的稳定性和性能,尤其在部分可观测环境中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。