Skip to main content
QUICK REVIEW

[论文解读] Safe Optimal Control Using Stochastic Barrier Functions and Deep Forward-Backward SDEs

Marcus A. Pereira, Ziyi Wang|arXiv (Cornell University)|Sep 2, 2020
Fault Detection and Control Systems参考文献 22被引用 10
一句话总结

本文提出了一种新颖的端到端可微分深度学习框架,用于使用随机障碍函数和深度前向-后向随机微分方程(FBSDEs)实现安全的随机最优控制。通过将可微凸优化层(特别是安全的二次规划层)与深度FBSDEs相结合,该方法在确保几乎必然安全的同时,实现了通过反向传播进行的端到端训练,在具有状态和控制约束的高维随机系统中表现出色。

ABSTRACT

This paper introduces a new formulation for stochastic optimal control and stochastic dynamic optimization that ensures safety with respect to state and control constraints. The proposed methodology brings together concepts such as Forward-Backward Stochastic Differential Equations, Stochastic Barrier Functions, Differentiable Convex Optimization and Deep Learning. Using the aforementioned concepts, a Neural Network architecture is designed for safe trajectory optimization in which learning can be performed in an end-to-end fashion. Simulations are performed on three systems to show the efficacy of the proposed methodology.

研究动机与目标

  • 开发一种可扩展的、基于第一性原理的随机最优控制方法,确保在状态和控制约束下的安全性。
  • 弥合深度学习的表征能力与控制障碍函数(CBFs)在随机系统中可验证的安全保证之间的差距。
  • 通过在深度FBSDE架构中嵌入可微凸优化层,实现神经网络在轨迹优化中的端到端训练。
  • 将随机零化控制障碍函数(ZCBFs)的理论扩展至具有扩散过程的一般随机系统。
  • 通过仿真展示该框架在具有安全约束的高维随机系统中的有效性。

提出的方法

  • 该框架使用前向-后向随机微分方程(FBSDEs)建模随机最优控制的哈密顿-雅可比-贝尔曼(HJB)方程,从而通过深度学习求解。
  • 使用损失函数强制终端条件和终端梯度,训练深度神经网络以近似值函数及其梯度。
  • 嵌入一个可微二次规划(QP)层,以在每个时间步计算安全的控制输入,确保满足随机障碍函数(sCBF)约束。
  • sCBF层通过求解包含系统动力学、噪声和障碍函数导数的原始-对偶内点法(PDIPM)QP来实现安全性。
  • 训练过程使用随机梯度下降(Adam)优化器,损失函数结合了终端值、梯度和正则化项。
  • 该架构整合了LSTM和全连接层,以建模时变值函数动态及其梯度,实现时间泛化能力。

实验结果

研究问题

  • RQ1能否在基于深度FBSDE的最优控制中有效集成随机障碍函数,以在过程噪声存在下确保几乎必然安全?
  • RQ2如何将可微凸优化层嵌入深度FBSDE中,以在保持安全约束的同时实现端到端训练?
  • RQ3所提出的框架在具有复杂状态和控制约束的高维随机系统中可扩展到何种程度?
  • RQ4将sCBFs与FBSDEs结合是否相比标准深度FBSDE控制器能提升安全性和收敛性?
  • RQ5该框架能否通过整个优化与动力学链的反向传播实现端到端训练?

主要发现

  • 所提出的框架通过在深度FBSDE架构中嵌入可微sCBF层,成功在随机系统中实现了几乎必然安全。
  • 该方法通过QP层和FBSDE动力学的反向传播,实现了值函数和控制策略的端到端训练。
  • 在三个系统(包括多智能体汽车系统)的仿真中,控制器在优化轨迹的同时保持了安全距离(最小2倍车半径)。
  • 损失函数包含终端值、梯度和正则化项,有助于稳定训练并改善收敛性。
  • 在所有测试案例中,该框架在随机扰动下均表现出对安全约束的一致满足,优于基线方法。
  • 基于PDIPM的QP层集成,使得每个时间步都能高效且可微地计算安全控制输入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。