[论文解读] Offline Reinforcement Learning for Autonomous Driving with Safety and Exploration Enhancement
本文通过在BCQ算法中引入可学习的参数噪声以提升探索多样性,并结合基于李雅普诺夫的稳定性约束以限制探索区域在安全状态范围内,提出了一种增强的离线强化学习框架,用于自动驾驶。该方法在高速公路和停车场景中,相较于当前最优的离线强化学习算法,实现了更优的驾驶安全性和性能表现。
Reinforcement learning (RL) is a powerful data-driven control method that has been largely explored in autonomous driving tasks. However, conventional RL approaches learn control policies through trial-and-error interactions with the environment and therefore may cause disastrous consequences such as collisions when testing in real-world traffic. Offline RL has recently emerged as a promising framework to learn effective policies from previously-collected, static datasets without the requirement of active interactions, making it especially appealing for autonomous driving applications. Despite promising, existing offline RL algorithms such as Batch-Constrained deep Q-learning (BCQ) generally lead to rather conservative policies with limited exploration efficiency. To address such issues, this paper presents an enhanced BCQ algorithm by employing a learnable parameter noise scheme in the perturbation model to increase the diversity of observed actions. In addition, a Lyapunov-based safety enhancement strategy is incorporated to constrain the explorable state space within a safe region. Experimental results in highway and parking traffic scenarios show that our approach outperforms the conventional RL method, as well as state-of-the-art offline RL algorithms.
研究动机与目标
- 解决现有用于自动驾驶的离线强化学习(RL)算法在探索方面保守且低效的局限性。
- 通过在扰动模型中引入可学习的参数噪声,提升离线强化学习中的策略多样性与探索效率。
- 通过引入基于李雅普诺夫的稳定性约束,限制动作仅在状态空间的安全区域中,从而提升探索过程中的安全性。
- 在高速公路和停车等真实自动驾驶场景中评估所提方法。
- 在安全性、效率和成功率方面,证明该方法相较于标准强化学习与当前最优的离线强化学习算法具有持续的性能优势。
提出的方法
- 通过在扰动模型中用可学习的参数噪声替代固定噪声,扩展了批量约束Q学习(BCQ)算法,以提升动作多样性。
- 在训练过程中优化可学习的噪声参数,使其能根据状态自适应调整扰动幅度,从而提升探索效率。
- 构建基于李雅普诺夫的安全函数,对导致不安全状态的动作施加惩罚,确保智能体仅在预定义的安全区域内探索。
- 通过引入风险因子,将安全约束整合到Q学习目标中,限制状态转移仅保留在维持李雅普诺夫稳定性的范围内。
- 采用深度神经网络参数化策略和Q函数,并使用经验回放与目标网络以提升训练稳定性。
- 在高速公路和停车场景中,使用真实世界驾驶数据集进行实验,评估指标包括回报、成功率、与障碍物的最小距离以及控制平滑度。
实验结果
研究问题
- RQ1在扰动模型中引入可学习的参数噪声,是否能提升自动驾驶离线强化学习中的探索多样性与策略性能?
- RQ2基于李雅普诺夫的安全约束是否能有效限制探索区域在安全状态范围内,同时不牺牲学习效率?
- RQ3在真实世界驾驶场景中,该方法相较于标准BCQ及其他当前最优的离线强化学习算法,在安全性和性能方面表现如何?
- RQ4增强的探索与安全约束相结合,能在多大程度上提升驾驶成功率与乘坐舒适度?
- RQ5该框架在高速公路和停车库等复杂动态交通环境中,是否能实现更好的泛化能力与鲁棒性?
主要发现
- 所提方法在高速公路和停车场景中均优于标准BCQ与当前最优的离线强化学习算法,实现了更高的评估回报与更快的训练收敛速度。
- 在扰动模型中引入可学习的参数噪声,显著提升了观测到的状态-动作对的多样性,如在停车场景中通过主成分分析(PCA)生成的状态-动作密度图所示。
- 与Noisy BCQ相比,基于李雅普诺夫的安全增强使高速公路场景中与周围车辆的最小距离平均提升了超过5米,而Noisy BCQ频繁低于5米。
- 所提方法在转向控制上更平稳,加速度更低且振荡更少,表明乘坐舒适度更高,机械应力更小。
- 在停车场景中,所提方法在所有对比方法中取得了最高的成功率,优于BCQ与Noisy BCQ。
- 可学习噪声与安全约束的结合,使智能体在保持安全的前提下更有效地探索,其平衡效果优于仅依赖其中一者的方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。