Skip to main content
QUICK REVIEW

[论文解读] ShieldNN: A Provably Safe NN Filter for Unsafe NN Controllers

James Ferlez, Mahmoud Elnaggar|arXiv (Cornell University)|Jun 16, 2020
Adversarial Robustness in Machine Learning参考文献 28被引用 16
一句话总结

ShieldNN 是一种可证明安全的、基于 ReLU 的神经网络滤波器,可针对由运动学自行车模型(KBM)建模的自动驾驶车辆,对任意无记忆控制器产生的不安全控制输入进行校正。通过利用一种新型的屏障函数和实时滤波,ShieldNN 在 CARLA 模拟中将障碍物碰撞减少了 99.4–100%,并在深度强化学习训练过程中通过集成使用提升了 28% 的样本效率。

ABSTRACT

In this paper, we develop a novel closed-form Control Barrier Function (CBF) and associated controller shield for the Kinematic Bicycle Model (KBM) with respect to obstacle avoidance. The proposed CBF and shield -- designed by an algorithm we call ShieldNN -- provide two crucial advantages over existing methodologies. First, ShieldNN considers steering and velocity constraints directly with the non-affine KBM dynamics; this is in contrast to more general methods, which typically consider only affine dynamics and do not guarantee invariance properties under control constraints. Second, ShieldNN provides a closed-form set of safe controls for each state unlike more general methods, which typically rely on optimization algorithms to generate a single instantaneous for each state. Together, these advantages make ShieldNN uniquely suited as an efficient Multi-Obstacle Safe Actions (i.e. multiple-barrier-function shielding) during training time of a Reinforcement Learning (RL) enabled Neural Network controller. We show via experiments that ShieldNN dramatically increases the completion rate of RL training episodes in the presence of multiple obstacles, thus establishing the value of ShieldNN in training RL-based controllers.

研究动机与目标

  • 开发一种与控制器无关的安全滤波器,确保任何无记忆神经网络控制器在自动驾驶车辆中的可证明安全性。
  • 解决数据训练控制器中缺乏可证明安全性保证的问题,尤其是在深度强化学习(DRL)设置下。
  • 通过集成一种可防止不安全状态访问的安全滤波器,提升 DRL 训练过程中的样本效率。
  • 在具有动态障碍物的模拟环境中验证滤波器的安全性和鲁棒性。
  • 为运动学自行车模型(KBM)动力学设计一类新型屏障函数。

提出的方法

  • ShieldNN 采用一类包含三个实值参数(包括安全半径)的新型屏障函数,用于为 KBM 定义安全控制集合。
  • 该方法由两部分组成:一个可 sound 验证所选屏障函数的验证器,以及一个用于设计安全滤波神经网络的合成器。
  • 安全滤波器是一种基于 ReLU 的神经网络,其输入为控制器的原始控制输入和系统状态,输出为安全控制动作。
  • 不安全的控制动作被过滤并替换为安全替代动作,而安全动作则保持不变通过。
  • 滤波器经过训练,以确保闭环系统始终处于屏障函数所定义的安全集合内。
  • 该框架被集成到使用摄像头和 LIDAR 衍生状态输入的 CARLA 模拟环境中,并与 PPO 智能体结合使用。

实验结果

研究问题

  • RQ1能否设计一种神经网络滤波器,以可证明的方式确保任意控制器在运动学自行车模型中的安全性?
  • RQ2ShieldNN 在自动驾驶车辆控制场景中减少与障碍物碰撞的效率如何?
  • RQ3与未使用安全滤波的训练相比,集成 ShieldNN 进行 DRL 训练是否能提升样本效率?
  • RQ4当部署在具有分布偏移的新环境时,ShieldNN 的鲁棒性如何?
  • RQ5能否为 KBM 构建一种新型屏障函数,使其在基于学习的控制背景下实现可证明的安全性保证?

主要发现

  • 在使用 DRL 训练的控制器进行的 CARLA 模拟中,ShieldNN 将障碍物碰撞数量减少了 99.4% 至 100%。
  • 当训练过程中未使用 ShieldNN 时,智能体在相同数量的训练轮次中获得的累积奖励减少了 28%,表明集成滤波器可提升样本效率。
  • 在新型城市道路环境的迁移学习场景中,启用 ShieldNN 的智能体在 200 次测试轮次中成功避开了所有障碍物,表现出良好的泛化能力。
  • 使用 ShieldNN 的智能体在避障行为上表现出更保守的特征,表明其具备更高的安全裕度。
  • 验证器正确验证了 KBM 的屏障函数,从而为滤波器设计提供了可靠的安全保证。
  • 将 ShieldNN 作为安全滤波器集成后,未影响控制器在安全轨迹上的性能,保持了其预期行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。