[论文解读] Safe Reinforcement Learning for Autonomous Vehicles through Parallel Constrained Policy Optimization
该论文提出并行约束策略优化(PCPO),一种用于自动驾驶车辆的安全强化学习算法,通过在包含信任区域约束的三网络演员-critic框架中整合风险函数,实现安全控制。PCPO通过将期望风险控制在预设阈值以下,确保训练过程中的安全性,在车道保持和多车交叉路口任务中,相比PPO和CPO,实现了更快的学习速度和更高的数据效率,同时保持训练期间的安全性。
Reinforcement learning (RL) is attracting increasing interests in autonomous driving due to its potential to solve complex classification and control problems. However, existing RL algorithms are rarely applied to real vehicles for two predominant problems: behaviours are unexplainable, and they cannot guarantee safety under new scenarios. This paper presents a safe RL algorithm, called Parallel Constrained Policy Optimization (PCPO), for two autonomous driving tasks. PCPO extends today's common actor-critic architecture to a three-component learning framework, in which three neural networks are used to approximate the policy function, value function and a newly added risk function, respectively. Meanwhile, a trust region constraint is added to allow large update steps without breaking the monotonic improvement condition. To ensure the feasibility of safety constrained problems, synchronized parallel learners are employed to explore different state spaces, which accelerates learning and policy-update. The simulations of two scenarios for autonomous vehicles confirm we can ensure safety while achieving fast learning.
研究动机与目标
- 解决现有自动驾驶强化学习(RL)方法缺乏安全保证的问题。
- 克服风险中性RL的局限性,避免在新奇或复杂场景中产生不安全行为。
- 开发一种安全的强化学习算法,在确保训练期间策略安全的同时,保持高速学习速度和高数据效率。
- 实现安全探索,并在不违反安全约束的前提下收敛至最优或近似最优策略。
- 在真实世界相关的自动驾驶任务(包括车道保持和交叉路口通行)上验证该方法。
提出的方法
- PCPO将标准的演员-critic架构扩展为三组件框架,使用三个独立的神经网络:一个用于策略,一个用于价值函数,以及一个新网络用于近似期望风险函数。
- 应用信任区域约束,允许大步长策略更新,同时保持单调改进,防止灾难性策略退化。
- 对风险函数施加约束,使其期望值保持在预设风险阈值以下,从而在学习过程中确保安全性。
- 同步的并行学习者可同时探索状态空间的不同区域,加速探索并提升收敛至安全策略的速度。
- 该算法采用约束优化公式,目标是在满足风险约束的前提下最大化期望回报。
- 通过将风险度量融入学习目标,实现风险导向的探索,促进在安全、可控区域内的探索。
实验结果
研究问题
- RQ1强化学习算法是否能在不依赖人类演示或预定义安全动作的前提下,在自动驾驶任务中实现训练期间的安全性?
- RQ2如何在深度强化学习框架中显式建模并约束风险,以确保在复杂驾驶环境中实现安全策略学习?
- RQ3与标准PPO和CPO相比,所提出的PCPO算法在学习速度和数据效率方面提升了多少?
- RQ4在如交叉路口通行等安全关键场景中,PCPO是否能防止智能体收敛至不安全或次优策略?
- RQ5并行学习在高维连续控制任务中如何提升安全策略优化的可行性与收敛性?
主要发现
- 在车道保持任务中,PCPO的学习速度相比CPO快35%,相比PPO快70%以上,同时保持了安全性。
- 在交叉路口通行任务中,PCPO在约800个训练周期后收敛至理论最优回报值0,优于CPO,后者在1400个周期后仅达到回报-5。
- PCPO在整个训练过程中将期望风险值维持在预设安全阈值以下,而PPO的风险值达到30,超过安全阈值5。
- PCPO与CPO的风险曲线均呈现单调下降并稳定在安全边界附近,证实了安全约束的一致性执行。
- PCPO在数据效率方面表现更优,且相比PPO和CPO,显著降低了陷入不安全或次优策略的可能性。
- 在两项任务中,PCPO均实现了安全性、学习速度与回报优化之间的更优平衡,验证了其在真实世界自动驾驶应用中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。