Skip to main content
QUICK REVIEW

[论文解读] SafeLight: A Reinforcement Learning Method toward Collision-free Traffic Signal Control

Wenlu Du, Junyi Ye|arXiv (Cornell University)|Nov 20, 2022
Traffic control and management被引用 8
一句话总结

SafeLight 提出了一种面向交通信号控制的安全增强型强化学习框架,通过将领域特定的安全规则整合到强化学习流程中,实现近乎零碰撞。通过采用残差学习方法将安全模块嵌入状态、动作、奖励和损失函数中,该方法在安全性(0.0次碰撞)和通行效率(平均延迟13.07秒)方面均优于基线强化学习方法,展现出在不同环境和动作空间下的稳健泛化能力。

ABSTRACT

Traffic signal control is safety-critical for our daily life. Roughly one-quarter of road accidents in the U.S. happen at intersections due to problematic signal timing, urging the development of safety-oriented intersection control. However, existing studies on adaptive traffic signal control using reinforcement learning technologies have focused mainly on minimizing traffic delay but neglecting the potential exposure to unsafe conditions. We, for the first time, incorporate road safety standards as enforcement to ensure the safety of existing reinforcement learning methods, aiming toward operating intersections with zero collisions. We have proposed a safety-enhanced residual reinforcement learning method (SafeLight) and employed multiple optimization techniques, such as multi-objective loss function and reward shaping for better knowledge integration. Extensive experiments are conducted using both synthetic and real-world benchmark datasets. Results show that our method can significantly reduce collisions while increasing traffic mobility.

研究动机与目标

  • 为解决现有基于强化学习的交通信号控制方法中过度侧重通行效率而忽视安全、导致碰撞风险上升的关键问题。
  • 将领域特定的交通规则(如闯红灯、黄灯时长、左转冲突)系统性地整合到强化学习框架中,以实现无碰撞运行。
  • 开发一种模块化、可泛化的安全增强机制,可无缝集成到现有强化学习主干网络中,无需重新训练。
  • 在不同动作空间和强化学习架构下,于合成与真实世界基准上评估该方法的性能表现。
  • 证明安全约束可被可靠地强制执行,而不会牺牲通行效率,也无需大量奖励工程。

提出的方法

  • 基于既定的交通规则构建安全模型,涵盖闯红灯、黄灯持续时间及左转冲突等要素。
  • 将安全模块集成到强化学习流程的四个核心组件中:状态表示、动作空间、奖励设计与损失函数。
  • 采用残差学习框架,将安全执行与主强化学习策略解耦,实现稳定训练与模块化部署。
  • 使用多目标损失函数,平衡通行效率(最小化延迟)与安全性(避免碰撞),并通过动作干预实现安全强制。
  • SafeLight-Act 在安全模型判定某动作不安全时进行干预,引导智能体选择安全动作;而 SafeLight-R 则利用残差学习对策略进行精细化优化。
  • 安全模型在干预后连续评估多个状态,确保不会出现不安全配置,尤其在黄灯阶段表现更可靠。

实验结果

研究问题

  • RQ1现有基于强化学习的交通信号控制方法是否可在不损害通行效率的前提下实现安全运行?
  • RQ2如何系统性地将领域特定的交通规则整合到强化学习训练流程中?
  • RQ3所提出的安全部件是否能在不同强化学习主干网络和动作空间设计(循环式 vs. 非循环式)中实现良好泛化?
  • RQ4该方法是否能在维持或提升通行效率的同时实现近乎零碰撞?
  • RQ5安全规则的集成对训练收敛性与稳定性有何影响?

主要发现

  • SafeLight 在 IPPO 基准测试中实现 0.0 次碰撞,显著优于次优方法 Syn-R(0.8 次碰撞)与基线 3DQN(24.5 次碰撞)。
  • SafeLight-Act 将平均延迟降低至 16.57 秒,在保障安全的同时优于主干网络 3DQN(10.66 秒)的通行效率表现。
  • SafeLight-Loss 在所有方法中实现最低平均延迟(13.07 秒),仅产生 3.8 次碰撞,证明了其在通行效率与安全性之间的有效权衡。
  • 该方法在不同动作空间中表现出良好泛化能力:SafeLight-Loss 与 SafeLight-Act 在循环与非循环设置下均保持优异性能,而 Syn-R 在非循环设置下失效。
  • SafeLight-Act 展现出更快收敛速度与稳定性能,偶发的安全干预未对学习过程造成负面影响,表明其对延迟奖励信号具有强鲁棒性。
  • 碰撞可视化分析显示,SafeLight-Act 由于存在时间边界情况,无法完全避免黄灯阶段的碰撞;但 SafeLight-R 通过残差优化成功规避了此类情况。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。