Skip to main content
QUICK REVIEW

[论文解读] Primal-dual Learning for the Model-free Risk-constrained Linear Quadratic Regulator

Feiran Zhao, Keyou You|arXiv (Cornell University)|Nov 22, 2020
Advanced Control Systems Optimization参考文献 36被引用 5
一句话总结

该论文提出了一种无模型的原始-对偶学习框架,用于风险约束的线性二次型调节器(LQR)控制,其中控制器通过在状态预测方差约束下的稳定仿射反馈策略(u = -Kx + l)进行学习。尽管存在非凸性,该方法通过利用局部梯度主导性和强对偶性,实现了全局收敛,证明了零对偶间隙,并在未知系统模型的情况下实现了高效的策略优化。

ABSTRACT

Risk-aware control, though with promise to tackle unexpected events, requires a known exact dynamical model. In this work, we propose a model-free framework to learn a risk-aware controller with a focus on the linear system. We formulate it as a discrete-time infinite-horizon LQR problem with a state predictive variance constraint. To solve it, we parameterize the policy with a feedback gain pair and leverage primal-dual methods to optimize it by solely using data. We first study the optimization landscape of the Lagrangian function and establish the strong duality in spite of its non-convex nature. Alongside, we find that the Lagrangian function enjoys an important local gradient dominance property, which is then exploited to develop a convergent random search algorithm to learn the dual function. Furthermore, we propose a primal-dual algorithm with global convergence to learn the optimal policy-multiplier pair. Finally, we validate our results via simulations.

研究动机与目标

  • 开发一种用于未知动力学下线性系统中风险感知控制的无模型强化学习框架。
  • 解决在无已知系统模型的情况下,基于状态方差风险约束的约束最优控制挑战。
  • 为非凸、风险约束的LQR设置中的策略优化建立理论保证。
  • 证明在仿射反馈策略的约束、非凸优化景观下强对偶性与零对偶间隙。
  • 设计一种原始-对偶算法,实现对最优策略-乘子对的全局收敛学习。

提出的方法

  • 将风险约束的LQR表述为带有一步状态预测方差约束的无限时域约束优化问题。
  • 将最优策略表示为仿射反馈形式:u∗(x) = −Kx + l,并联合优化增益对(K, l)。
  • 引入带有风险约束乘子的拉格朗日函数,并证明在稳定策略集上拉格朗日函数具有局部梯度主导性和利普希茨连续性。
  • 尽管目标函数、约束条件和策略集均非凸,但在Slater条件成立时,仍能建立强对偶性与零对偶间隙。
  • 提出一种原始-对偶算法,结合零阶优化进行策略学习,以及基于投影的次梯度下降进行乘子更新。
  • 采用带边界梯度估计的随机搜索与基于投影的更新,以确保全局收敛。

实验结果

研究问题

  • RQ1在具有仿射反馈策略的非凸、风险约束LQR问题中,强对偶性是否仍能成立?
  • RQ2在稳定仿射策略集上,拉格朗日函数是否表现出梯度主导性与利普希茨性质?
  • RQ3在无模型、风险约束的LQR设置中,原始-对偶算法能否实现全局收敛?
  • RQ4当动力学模型未知且优化问题非凸时,是否可实现零对偶间隙?
  • RQ5在缺乏系统模型知识的情况下,如何对策略与乘子进行联合优化,并保证理论收敛性?

主要发现

  • 在稳定仿射策略集上,拉格朗日函数表现出局部梯度主导性与利普希茨连续性,从而支持收敛性保证。
  • 在Slater条件成立时,即使问题为非凸,强对偶性仍成立且对偶间隙为零。
  • 所提出的原始-对偶算法仅使用系统轨迹数据,即可实现对最优策略-乘子对的全局收敛。
  • 在有界噪声下,随机搜索方法中的梯度估计保持一致有界,确保收敛稳定性。
  • 通过投影次梯度下降进行的乘子更新在递减步长下收敛,达到次线性收敛速率。
  • 该方法成功学习到风险感知控制器,且无需预先掌握系统动力学A与B的知识。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。