[论文解读] Inverse Optimal Safety Filters
本文提出了一类针对控制与扰动呈仿射关系的非线性系统的逆最优安全滤波器,在确保无限时域安全的同时保持对未知扰动的鲁棒性。通过将控制屏障函数(CBF)理论扩展至逆最优性,该方法设计出在安全与常规控制性能之间实现平衡的滤波器,并证明了尽管在实时控制效率上为次优,但保守的安全优化滤波器在无限时间范围内仍为最优。
CBF-QP safety filters are pointwise minimizers of the control effort at a given state vector, i.e., myopically optimal at each time instant. But are they optimal over the entire infinite time horizon? What does it even mean for a controlled dynamic systems to be "optimally safe" as opposed to, conventionally "optimally stable"? When disturbances, deterministic and stochastic, have unknown upper bounds, how should safety be defined to allow a graceful degradation under disturbances? Can safety filters be designed to guarantee such weaker safety properties as well as the optimality of safety over the infinite time horizon? We pose and answer these questions for general systems affine in control and disturbances and illustrate the answers using several examples. In the process, using the existing QP safety filters, as well as more general safety-ensuring feedbacks, we generate entire families of safety filters which are optimal over the infinite horizon though they are conservative (favoring safety over `alertness') relative to the standard QP.
研究动机与目标
- 定义并形式化‘最优安全’控制系统的概念,将其与传统的‘最优稳定’或‘短视最优’设计区分开来。
- 解决标准CBF-QP滤波器的局限性,后者仅在每个瞬间最优,而非在整个无限时间范围内最优。
- 开发逆最优的安全滤波器——即在整个无限时间范围内最优,同时在未知确定性与随机扰动下保持鲁棒性。
- 将现有基于CBF的安全滤波器推广至可处理未知扰动界的情形,实现在不确定性下的平稳退化。
- 建立理论条件,确保安全滤波器在随机或高相对阶系统中仍能实现无限时域最优性与鲁棒安全。
提出的方法
- 使用控制屏障函数(CBFs)作为安全约束,并构建二次规划(QP)以最小化与标称控制输入的偏差,从而确保逐点安全。
- 通过构造一个奖励安全(屏障函数衰减加快)与标称控制一致性双重目标的代价泛函,引入逆最优性,实现无限时域最优性。
- 应用Legendre-Fenchel变换与Young不等式,推导代价函数的对偶表示,从而导出最优性条件。
- 利用无穷小生成算子分析推导出安全的充分条件,确保在未知噪声协方差下,系统漂移项与扩散项满足屏障衰减条件。
- 通过引入涉及二阶导数与随机项的修正屏障导数条件,将框架推广至具有未知噪声协方差的随机系统。
- 提出非QP、逆最优的安全滤波器,即使在实时响应上不如标准QP滤波器‘灵敏’,但在长期安全性能上表现更优。
实验结果
研究问题
- RQ1安全滤波器在无限时间范围内最优意味着什么?它与CBF-QP滤波器中仅逐点(短视)最优有何不同?
- RQ2能否设计出逆最优的安全滤波器——即在整个无限时间范围内最优,同时对未知扰动保持鲁棒性?
- RQ3当扰动上界未知时,应如何定义安全?何种性质可确保在不确定性下的平稳退化?
- RQ4非QP安全滤波器能否实现逆最优性,并在长期安全与鲁棒性方面超越标准QP滤波器?
- RQ5在确定安全滤波器最优性结构时,$L_g h$ 项起什么作用?它与逆最优控制中 $L_g V$ 控制器有何关联?
主要发现
- 本文证明,标准CBF-QP滤波器在无限时间范围内并非最优,因其为最小化实时控制努力而牺牲了长期安全。
- 通过最小化一个同时奖励安全与标称控制一致性的代价泛函,构建了在无限时间范围内最优的逆最优安全滤波器。
- 对于具有未知噪声协方差的随机系统,本文利用无穷小生成算子 $\mathcal{L}h(x)$ 推导出充分条件,确保 $-\alpha(h(x)) \leq \mathcal{L}h(x) \leq -\alpha_0(h(x))$,从而保证期望意义下的无超调行为。
- 所提出的滤波器即使在未知扰动下仍能实现逆最优性,通过修正的屏障导数条件,理论保证了安全与鲁棒性。
- 理论结果表明,非QP、逆最优滤波器在长期安全性能上可超越标准QP滤波器,尽管其在实时响应上更为保守。
- 该框架可推广至高相对阶CBF系统与随机系统,并为已知与未知噪声协方差情形分别推导出明确条件。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。