[论文解读] BarrierNet: A Safety-Guaranteed Layer for Neural Networks
BarrierNet 通过使用软性、自适应的高阶控制屏障函数(HOCBFs),为神经网络控制器引入了一种可微分、端到端可训练的安全层。通过将 HOCBFs 嵌入具有环境依赖、可学习参数的可微分二次规划(QP)中,BarrierNet 在保证安全的同时降低了传统 CBFs 的保守性,从而在自主导航和交通汇入等任务中实现了基于梯度下降的有效训练。
This paper introduces differentiable higher-order control barrier functions (CBF) that are end-to-end trainable together with learning systems. CBFs are usually overly conservative, while guaranteeing safety. Here, we address their conservativeness by softening their definitions using environmental dependencies without loosing safety guarantees, and embed them into differentiable quadratic programs. These novel safety layers, termed a BarrierNet, can be used in conjunction with any neural network-based controller, and can be trained by gradient descent. BarrierNet allows the safety constraints of a neural controller be adaptable to changing environments. We evaluate them on a series of control problems such as traffic merging and robot navigations in 2D and 3D space, and demonstrate their effectiveness compared to state-of-the-art approaches.
研究动机与目标
- 解决传统控制屏障函数(CBFs)在不确定或动态环境中过度保守的问题。
- 通过使 CBFs 可微分且可训练,实现神经网络控制器的端到端训练并保证安全性。
- 开发一种模块化、可解释的安全层,通过屏障函数中的可学习参数,实现对环境变化的自适应。
- 证明在现实世界控制任务中,安全性可被保持的同时提升控制器的性能与适应性。
提出的方法
- 提出一种新型可微分 HOCBF 公式,将类-𝐾 函数替换为可学习、与环境相关的惩罚函数 $ p_i(m{z}) $,在不损失安全保证的前提下软化硬性约束。
- 将 HOCBF 约束嵌入可微分的二次规划(QP)中,支持反向传播,从而实现对整个系统的基于梯度的训练。
- 引入一个可训练的安全层——BarrierNet,其输入为观测值 $ m{z} $ 和上游神经网络的输出,通过 QP 优化输出安全的控制指令。
- 采用损失函数,最小化与上游网络参考控制的偏差,同时满足安全约束,从而实现联合训练。
- 使用屏障函数 $ b(m{x}) $ 的高阶导数,其中 $ L_f b(m{x}) $、$ L_f^2 b(m{x}) $ 和 $ L_g L_f b(m{x}) $ 用于定义安全约束。
- 通过反向传播训练惩罚函数 $ p_1(m{z}) $、$ p_2(m{z}) $,使系统能够根据环境上下文自适应调整安全裕度。
实验结果
研究问题
- RQ1在不确定或动态环境中,能否在保持安全保证的前提下使控制屏障函数更加不保守?
- RQ2能否将 HOCBFs 重新表述为可微分、可学习的组件,以实现与深度神经网络的端到端训练?
- RQ3通过屏障函数的数据驱动参数化,安全层能否自适应环境变化?
- RQ4所提出的 BarrierNet 在导航与汇入任务中,是否在安全性和性能上均优于标准神经控制器和基线 CBF 方法?
主要发现
- BarrierNet 在 2D 和 3D 机器人导航任务中成功保证了避碰,如图 12b 所示的安全部轨迹所示;而无安全约束的标准全连接(FC)网络则导致碰撞。
- BarrierNet 中的 HOCBF 值 $ b(m{x}) $ 在时间上始终保持非负,确认了安全性;而 FC 基线中的该值下降至零以下,表明约束被违反。
- BarrierNet 学习到的惩罚函数 $ p_1(m{z}) $ 和 $ p_2(m{z}) $ 随环境输入变化,展示了对障碍物接近程度响应的自适应安全裕度。
- 尽管控制指令存在微小跟踪误差,BarrierNet 控制器仍能生成接近 HOCBF 控制器真实轨迹的路径,表明其有效学习了安全行为。
- 如图 11 所示,BarrierNet 通过梯度下降实现的端到端训练是可行且稳定的,损失函数与惩罚函数曲线均显示收敛。
- 通过用可学习、与环境相关的项替代固定的类-𝐾 函数,该方法降低了 HOCBFs 的保守性,提升了控制器性能,同时未牺牲安全性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。