Skip to main content
QUICK REVIEW

[论文解读] Automatic differentiation of Sylvester, Lyapunov, and algebraic Riccati equations

Ta-Chu Kao, Guillaume Hennequin|arXiv (Cornell University)|Nov 23, 2020
Model Reduction and Neural Networks参考文献 6被引用 6
一句话总结

本文推导了控制理论中Sylvester、Lyapunov和代数Riccati方程解的前向和反向自动微分规则。作者通过求解一个逆线性二次调节器(LQR)问题展示了其有效性,其中通过基于梯度的优化方法,利用离散时间代数Riccati方程(DARE)从观测轨迹中恢复状态代价矩阵Q。

ABSTRACT

Sylvester, Lyapunov, and algebraic Riccati equations are the bread and butter of control theorists. They are used to compute infinite-horizon Gramians, solve optimal control problems in continuous or discrete time, and design observers. While popular numerical computing frameworks (e.g., scipy) provide efficient solvers for these equations, these solvers are still largely missing from most automatic differentiation libraries. Here, we derive the forward and reverse-mode derivatives of the solutions to all three types of equations, and showcase their application on an inverse control problem.

研究动机与目标

  • 通过为控制理论中使用的关键矩阵方程提供可微求解器,填补自动微分(AD)库中的空白。
  • 在逆控制问题中实现基于梯度的优化,其中系统参数(如状态代价矩阵Q)需从观测轨迹中推断。
  • 将AD框架的适用范围扩展到广泛使用但此前在大多数AD库中不受支持的复杂控制理论方程。
  • 通过推导严格的前向和反向模式规则,为将这些导数集成到PyTorch、JAX和TensorFlow等主流AD库中奠定基础。
  • 通过使用合成数据的逆LQR具体应用,展示所推导导数的实际效用。

提出的方法

  • 通过对方程取微分,求解一个相关的新Sylvester/Lyapunov/Riccati方程,推导前向模式导数,得到切线矩阵。
  • 使用带对偶变量(拉格朗日乘子)的Lagrangian公式推导反向模式伴随变量,得到与原始矩阵方程形式相同的伴随方程。
  • 针对离散时间代数Riccati方程(DARE),利用隐函数定理和对称性约束,推导系统矩阵A、B和代价矩阵Q、R的伴随变量。
  • 在支持完整自动微分的OCaml数值库Owl中实现所推导的规则,并通过数值方法验证其正确性。
  • 通过使用L-BFGS优化方法最小化观测轨迹与预测轨迹之间的损失,将所推导的梯度应用于逆LQR问题。
  • 将DARE解作为神经网络式优化循环中的可微层,从合成数据中恢复未知的Q矩阵。

实验结果

研究问题

  • RQ1是否可以系统性地将自动微分应用于Sylvester、Lyapunov和代数Riccati方程的解,这些方程在控制理论中具有核心地位?
  • RQ2在标准谱条件(如无共同特征值)下,这些矩阵方程解的正确前向和反向模式导数是什么?
  • RQ3这些导数能否有效用于求解逆控制问题,例如从观测轨迹中推断LQR中的状态代价矩阵Q?
  • RQ4当通过所推导规则将梯度反向传播至DARE解时,逆LQR中的参数恢复精度如何?
  • RQ5这些可微求解器在多大程度上可被集成到PyTorch或JAX等现有AD框架中,以扩展其在控制与系统理论中的功能?

主要发现

  • 本文推导了连续和离散时间Sylvester、Lyapunov和代数Riccati方程的闭式前向和反向模式导数,且在谱性质条件下(如无共同特征值)可保证唯一性。
  • DARE的反向模式伴随变量被推导为对称矩阵,且伴随方程被证明等价于右侧项为对称矩阵的修正DARE。
  • 在逆LQR实验中,该方法成功地从30条长度为30的合成轨迹中恢复出真实的Q矩阵(1,0;0,0),采用L-BFGS优化。
  • 经过7次优化迭代后,损失函数ℓ(𝐐̂)收敛,且估计的𝐐̂的范数趋近于真实Q,表明参数恢复有效。
  • 所推导的导数已通过数值方法验证,并在Owl中实现,作者提供了开源代码以确保可复现性。
  • 该工作实现了控制系统的基于梯度的推断,例如从行为中学习代价函数,并填补了AD库中此前缺乏对这些方程支持的关键空白。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。