Skip to main content
QUICK REVIEW

[论文解读] Scalable Multiagent Driving Policies For Reducing Traffic Congestion

Jiaxun Cui, William Macke|arXiv (Cornell University)|Feb 26, 2021
Traffic control and management参考文献 24被引用 9
一句话总结

本文提出了一种可扩展的、分布式的多智能体强化学习框架,用于自动驾驶车辆,通过使用流出量作为交通效率的稳健指标,减少在大型开放道路网络中的交通拥堵。该方法引入了一种模块化迁移学习方法,将训练时间减少了80%,并首次展示了完全分布式的策略,其性能优于人类驾驶交通,且无需依赖通信基础设施。

ABSTRACT

Traffic congestion is a major challenge in modern urban settings. The industry-wide development of autonomous and automated vehicles (AVs) motivates the question of how can AVs contribute to congestion reduction. Past research has shown that in small scale mixed traffic scenarios with both AVs and human-driven vehicles, a small fraction of AVs executing a controlled multiagent driving policy can mitigate congestion. In this paper, we scale up existing approaches and develop new multiagent driving policies for AVs in scenarios with greater complexity. We start by showing that a congestion metric used by past research is manipulable in open road network scenarios where vehicles dynamically join and leave the road. We then propose using a different metric that is robust to manipulation and reflects open network traffic efficiency. Next, we propose a modular transfer reinforcement learning approach, and use it to scale up a multiagent driving policy to outperform human-like traffic and existing approaches in a simulated realistic scenario, which is an order of magnitude larger than past scenarios (hundreds instead of tens of vehicles). Additionally, our modular transfer learning approach saves up to 80% of the training time in our experiments, by focusing its data collection on key locations in the network. Finally, we show for the first time a distributed multiagent policy that improves congestion over human-driven traffic. The distributed approach is more realistic and practical, as it relies solely on existing sensing and actuation capabilities, and does not require adding new communication infrastructure.

研究动机与目标

  • 解决以往拥堵度量指标(如平均速度)在具有动态车辆进出的开放道路网络中易被操纵的局限性。
  • 为具有数百辆车辆的大型真实开放网络,开发一种可扩展的多智能体驾驶策略,以提升交通效率。
  • 设计一种仅依赖本地感知与执行、无需集中协调或新增通信基础设施的分布式多智能体强化学习策略。
  • 通过一种模块化迁移学习方法,将小规模网络中的策略迁移到大规模网络区域,从而减少大规模交通场景中的训练时间和计算成本。
  • 证明分布式策略可在不依赖通信基础设施的前提下,优于人类驾驶交通的拥堵缓解效果,验证其实际可行性和可扩展性。

提出的方法

  • 提出流出量拥堵度量指标——车辆离开网络的速率——作为平均速度的稳健替代方案,后者在开放网络中易受强化学习智能体操纵。
  • 设计一种混合奖励函数用于分布式多智能体强化学习,结合自私(基于速度)和协作(激励流出)成分,并引入出口奖励以鼓励及时离开。
  • 实施模块化迁移强化学习方法:在小规模场景中训练集中策略,并将其迁移到更大、更真实的网络(如密歇根州I-696高速公路)中的关键区域(如路口)。
  • 采用滑动窗口推理策略,在大规模网络中局部应用策略,以降低状态和动作空间的复杂度,同时保持性能。
  • 使用近端策略优化(PPO)进行策略训练,结合课程学习和奖励塑形,以稳定训练过程并提升收敛性。
  • 通过流出量和平均速度两种指标评估性能,与人类驾驶基线及从零开始训练的策略进行对比。

实验结果

研究问题

  • RQ1在具有动态车辆流入和流出的开放道路网络中,广泛使用的平均速度指标能否可靠地衡量交通效率?
  • RQ2与平均速度相比,流出量指标在开放网络场景中是否对强化学习智能体的操纵更具鲁棒性?
  • RQ3模块化迁移学习方法能否有效将多智能体驾驶策略从小型网络扩展到大型真实开放网络,同时减少训练时间?
  • RQ4仅依赖本地感知的完全分布式多智能体强化学习策略,是否能在开放网络中实现优于人类驾驶交通的交通效率?
  • RQ5在分布式设置中,结合自私、协作和出口奖励的混合奖励函数,是否能带来比现有奖励函数更高的流出量和更低的拥堵?

主要发现

  • 平均速度指标在开放道路网络中易被操纵:强化学习智能体可通过延迟车辆离开来人为提高平均速度,导致性能评估产生误导。
  • 流出量指标对操纵具有鲁棒性,更能真实反映开放网络中的系统级交通效率,因此是更优的评估指标。
  • 模块化迁移学习方法相比在完整大规模网络上从零开始训练,将训练时间减少了高达80%,同时实现的流出量高于人类驾驶交通和端到端训练的策略。
  • 表现最佳的分布式策略实现了每小时1796.76辆的流出量,较人类基线(1770.0)提升了1.6%,且在某些配置下优于集中式策略。
  • 混合奖励函数中,协作权重为10%(η₂=0.1)、完全自私(η₁=1)且出口奖励为20时,实现最高流出量(1796.76),证明了出口激励的重要性。
  • 分布式策略在不依赖通信基础设施的前提下,实现了相对于人类驾驶交通的统计显著拥堵缓解,验证了其在现实世界部署中的实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。