Skip to main content
QUICK REVIEW

[论文解读] Probabilistic Robust Linear Quadratic Regulators with Gaussian Processes

Alexander von Rohr, Matthias Neumann-Brosig|arXiv (Cornell University)|May 17, 2021
Gaussian Processes and Bayesian Inference参考文献 27被引用 10
一句话总结

本文提出了一种基于高斯过程(GP)后验分布的随机鲁棒线性二次调节器(LQR),而非最坏情况下的不确定性边界。通过在GP不确定性分布下优化期望性能,同时以预设概率确保稳定性,该方法在性能上显著优于最坏情况鲁棒控制和确定性等价设计,且通过可信区间提供了正式的随机鲁棒性保证。

ABSTRACT

Probabilistic models such as Gaussian processes (GPs) are powerful tools to learn unknown dynamical systems from data for subsequent use in control design. While learning-based control has the potential to yield superior performance in demanding applications, robustness to uncertainty remains an important challenge. Since Bayesian methods quantify uncertainty of the learning results, it is natural to incorporate these uncertainties into a robust design. In contrast to most state-of-the-art approaches that consider worst-case estimates, we leverage the learning method's posterior distribution in the controller synthesis. The result is a more informed and, thus, more efficient trade-off between performance and robustness. We present a novel controller synthesis for linearized GP dynamics that yields robust controllers with respect to a probabilistic stability margin. The formulation is based on a recently proposed algorithm for linear quadratic control synthesis, which we extend by giving probabilistic robustness guarantees in the form of credibility bounds for the system's stability.Comparisons to existing methods based on worst-case and certainty-equivalence designs reveal superior performance and robustness properties of the proposed method.

研究动机与目标

  • 为解决基于学习的控制中性能与鲁棒性之间的权衡问题,通过引入高斯过程的随机不确定性。
  • 克服基于高斯过程动力学模型的最坏情况鲁棒控制方法的过度保守性。
  • 开发一种控制器综合方法,以优化期望性能,同时确保概率稳定性保证。
  • 提供可由用户预先指定的闭环稳定性可信区间,实现形式化保证。
  • 证明利用完整后验分布可获得优于最坏情况或确定性等价方法的实证性能。

提出的方法

  • 将系统动力学的高斯过程模型线性化,得到由GP后验分布参数化的线性时不变(LTI)系统族。
  • 将鲁棒LQR综合问题表述为:在GP对系统参数的后验分布下,优化控制器的期望代价。
  • 用从GP后验分布中推导出的概率可信区间替代确定性的最坏情况边界,实现性能与鲁棒性之间的合理权衡。
  • 扩展近期的LQR综合算法,以整合概率鲁棒性约束,确保闭环系统以用户定义的置信水平保持稳定。
  • 通过后验分布的采样近似方法合成控制器,实现对期望性能和稳定性边界的高效计算。
  • 通过闭环系统矩阵谱半径的可信区间,提供形式化的概率鲁棒性保证。

实验结果

研究问题

  • RQ1我们能否通过利用GP模型的完整后验分布,而非依赖最坏情况边界,来提升基于学习控制的性能?
  • RQ2在使用基于GP的动力学模型时,如何正式保证以预设概率实现闭环稳定性?
  • RQ3在GP后验分布下优化期望性能,是否能带来优于最坏情况或确定性等价设计的实证性能?
  • RQ4在真实系统中,该方法的性能如何随数据量和模型精度变化?
  • RQ5与传统鲁棒控制方法相比,该方法在基于GP的设置中是否能以更低的保守性实现鲁棒性?

主要发现

  • 在合成系统上,所提出的概率鲁棒(PR)控制器在期望二次代价方面显著优于最坏情况鲁棒(R)和确定性等价(CE)控制器,尤其在3次和5次滚动(rollouts)时表现更优。
  • 在旋转摆仿真中,PR控制器实现了优于CE和R控制器的平均性能,且具备100%可行性与保证的稳定性。
  • 所有PR综合的可行实例均生成了稳定控制器,验证了概率鲁棒性保证的有效性。
  • 在合成系统上进行8次滚动时,PR控制器的性能与针对真实非线性系统设计的控制器相当,表明其具有高度的准确性和效率。
  • 与最坏情况鲁棒控制相比,该方法显著降低了保守性,从而在保持预设置信水平稳定性的前提下实现了更好的期望性能。
  • 性能提升的代价是存在一个微小且可预先指定的不稳定概率,该概率已通过形式化方法边界化并由用户控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。