[论文解读] Intelligent Coordination among Multiple Traffic Intersections Using Multi-Agent Reinforcement Learning
本文提出一种基于异步优势演员-critic(A3C)的多智能体强化学习方法,用于协调多个交叉路口的交通信号,根据实时交通密度动态调整绿灯时长。结果表明,将独立训练与全局奖励函数相结合,可使平均延迟减少38%,显著优于传统方法,在缓解拥堵方面表现突出。
We use Asynchronous Advantage Actor Critic (A3C) for implementing an AI agent in the controllers that optimize flow of traffic across a single intersection and then extend it to multiple intersections by considering a multi-agent setting. We explore three different methodologies to address the multi-agent problem - (1) use of asynchronous property of A3C to control multiple intersections using a single agent (2) utilise self/competitive play among independent agents across multiple intersections and (3) ingest a global reward function among agents to introduce cooperative behavior between intersections. We observe that (1) & (2) leads to a reduction in traffic congestion. Additionally the use of (3) with (1) & (2) led to a further reduction in congestion.
研究动机与目标
- 解决因车辆数量增加和交通模式不可预测性导致的城市交通拥堵问题。
- 开发一种自适应交通信号控制系统,根据实时交通流量动态调整绿灯时长,避免对固定信号方案进行人工调优。
- 探索并比较多种多智能体强化学习协同策略——单智能体异步、独立学习与全局奖励函数集成,以提升多个交叉路口的交通流效率。
- 评估这些方法在模拟城市交通环境中减少平均延迟和拥堵的有效性。
提出的方法
- 使用异步优势演员-critic(A3C)算法训练强化学习智能体,通过在模拟环境中试错学习最优信号配时策略。
- 采用状态空间表示方法,结合归一化的车辆密度与每个交叉路口的独热编码相位信息,使智能体能够感知交通状况与信号相位。
- 应用三种协同策略:(1) 在多个交叉路口上使用单个智能体的A3C,(2) 对每个交叉路口独立训练智能体,(3) 集成全局奖励函数以促进协作。
- 将全局奖励函数定义为个体智能体奖励的平均值(公式7),并通过加权平均(公式8)将其与个体奖励结合,以平衡局部与全局优化。
- 利用Aimsun Next仿真平台,基于符合威布尔分布的真实交通数据,构建包含多样化车辆类型与流量动态的逼真城市交通场景。
- 在多智能体设置中采用卷积-长短期记忆网络(Conv-LSTM)架构,处理表示多个交叉路口的时空状态矩阵,实现高效的多智能体状态表征。
实验结果
研究问题
- RQ1单个A3C智能体是否能通过异步更新有效协调多个交叉路口的信号配时?
- RQ2在每个交叉路口独立训练多个智能体,是否能实现自组织协同,从而改善交通流,优于固定信号配时?
- RQ3引入全局奖励函数在多大程度上提升了多个交叉路口的协同效率并减少拥堵?
- RQ4与固定信号配时相比,独立学习与全局奖励函数结合的方法在平均延迟减少方面表现如何?
主要发现
- 与固定信号配时(FST)60秒相比,强化学习智能体将平均延迟降低了33%;与FST 120秒相比,延迟降低了66.67%(单个交叉路口)。
- 独立训练智能体(InRL)的性能优于仅使用异步A3C,因为智能体在无显式通信的情况下学会了协调其绿灯相位。
- 引入全局奖励函数后,四个交叉路口的平均延迟降低了38%,显著优于FST 60秒,且随时间推移保持持续改善。
- 独立学习与全局奖励函数的结合实现了最佳的拥堵缓解效果,表明通过共享目标实现的协作能显著提升多智能体协同能力。
- 基于A3C的多智能体系统能有效适应动态交通状况,在所有测试场景中均优于基于规则的固定配时方案。
- 使用归一化的车辆密度与相位编码使模型能够优先考虑高流量路段,从而实现更高效的绿灯时间分配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。