Skip to main content
QUICK REVIEW

[论文解读] Robust Policy Iteration for Continuous-time Linear Quadratic Regulation

Bo Pang, Tao Bian|arXiv (Cornell University)|May 19, 2020
Adaptive Dynamic Programming Control参考文献 28被引用 4
一句话总结

本文在小而有界的扰动下,建立了Kleinman策略迭代在连续时间线性二次调节(LQR)中的鲁棒性。通过将策略迭代建模为一个离散时间非线性系统,证明了其局部输入-状态稳定性(ISS),确保在扰动较小时解保持有界并收敛至最优解的微小邻域。该结果为在模型不确定条件下,基于离策略数据驱动的LQR算法提供了鲁棒性保证。

ABSTRACT

This paper studies the robustness of policy iteration in the context of continuous-time infinite-horizon linear quadratic regulation (LQR) problem. It is shown that Kleinman's policy iteration algorithm is inherently robust to small disturbances and enjoys local input-to-state stability in the sense of Sontag. More precisely, whenever the disturbance-induced input term in each iteration is bounded and small, the solutions of the policy iteration algorithm are also bounded and enter a small neighborhood of the optimal solution of the LQR problem. Based on this result, an off-policy data-driven policy iteration algorithm for the LQR problem is shown to be robust when the system dynamics are subjected to small additive unknown bounded disturbances. The theoretical results are validated by a numerical example.

研究动机与目标

  • 分析Kleinman的连续时间LQR策略迭代算法在小扰动下的鲁棒性。
  • 在扰动有界且较小时,建立策略迭代过程的局部输入-状态稳定性(ISS)。
  • 证明即使初始控制增益为稳定且存在小误差,该算法仍能收敛至最优解的微小邻域。
  • 通过推导的稳定性结果,验证离策略数据驱动策略迭代的鲁棒性。

提出的方法

  • 将策略迭代过程建模为带有扰动输入的离散时间非线性系统。
  • 利用李雅普诺夫分析,证明在无误差情况下最优解的局部指数稳定性。
  • 应用输入-状态稳定性(ISS)理论,表明有界且小的扰动会导致与最优解的有界且微小的偏差。
  • 利用格朗沃尔不等式和矩阵范数分析,界定精确与扰动策略迭代迭代值之间的差异。
  • 利用黎卡提算子的压缩性质以及策略更新步骤中线性算子的可逆性。
  • 通过数值示例验证理论结果,展示在有界扰动下算法的收敛性。

实验结果

研究问题

  • RQ1Kleinman的连续时间LQR策略迭代算法在系统动态或策略评估中存在小而有界扰动时是否具有鲁棒性?
  • RQ2当存在扰动时,策略迭代过程是否保持有界并收敛至最优解的微小邻域?
  • RQ3基于模型的策略迭代的理论鲁棒性能否扩展至离策略数据驱动的策略迭代算法?
  • RQ4在存在扰动的情况下,策略迭代算法在何种条件下能保持局部输入-状态稳定性?
  • RQ5系统动态或函数逼近中的误差如何影响连续时间LQR中策略迭代的收敛行为?

主要发现

  • 连续时间LQR问题的最优解是无误差策略迭代过程的局部指数稳定平衡点。
  • 当扰动较小且有界时,策略迭代算法具有局部输入-状态稳定性(ISS),确保与最优解的偏差保持有界且微小。
  • 对于任意初始稳定控制增益,只要扰动足够小,算法即可收敛至最优解的微小邻域。
  • 证明了文献[11]中的离策略数据驱动策略迭代算法在系统动态中存在小的加法性有界扰动时具有鲁棒性。
  • 通过格朗沃尔不等式和矩阵范数分析,推导出精确与扰动迭代值之间误差的理论界。
  • 数值验证表明,即使在有界扰动下,算法仍保持稳定并收敛至最优解的微小邻域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。