[论文解读] Global Convergence of Policy Gradient Primal-dual Methods for Risk-constrained LQRs
本文提出了用于风险约束线性二次调节器(RC-LQR)的策略梯度原始-对偶方法,在模型已知和基于样本的设置下均实现了全局收敛。通过证明拉格朗日函数的强对偶性、强制性、局部梯度支配性以及Lipschitz连续梯度,作者在RC-LQR固有的非凸、约束优化景观下实现了全局收敛。
While the techniques in optimal control theory are often model-based, the policy optimization (PO) approach directly optimizes the performance metric of interest. Even though it has been an essential approach for reinforcement learning problems, there is little theoretical understanding on its performance. In this paper, we focus on the risk-constrained linear quadratic regulator (RC-LQR) problem via the PO approach, which requires addressing a challenging non-convex constrained optimization problem. To solve it, we first build on our earlier result that an optimal policy has a time-invariant affine structure to show that the associated Lagrangian function is coercive, locally gradient dominated and has local Lipschitz continuous gradient, based on which we establish strong duality. Then, we design policy gradient primal-dual methods with global convergence guarantees in both model-based and sample-based settings. Finally, we use samples of system trajectories in simulations to validate our methods.
研究动机与目标
- 解决风险约束LQR策略优化中缺乏理论收敛保证的问题。
- 在具有二次成本的连续、非凸约束马尔可夫决策过程(CMDP)中建立强对偶性。
- 为无限时域RC-LQR问题设计一种具有全局收敛性的原始-对偶方法。
- 通过使用采样系统轨迹的仿真验证该方法。
- 克服由于非凸方差类约束导致的全局梯度支配性缺失问题。
提出的方法
- 利用RC-LQR中最优策略的仿射结构,将问题重新表述为增益矩阵和偏置向量参数的形式。
- 证明拉格朗日函数具有强制性、局部梯度支配性,并且其梯度在局部具有Lipschitz连续性。
- 为具有二次成本的一类连续CMDP建立强对偶性,这是在非凸设置下的新结果。
- 设计一种原始-对偶算法,其中原始变量(策略)和对偶变量(乘子)通过交替使用策略梯度和对偶上升法进行更新。
- 在模型已知设置中使用精确梯度,在基于样本的设置中使用基于样本的梯度估计器。
- 应用Jensen不等式和求和论证,推导出对偶函数的收敛速率。
实验结果
研究问题
- RQ1尽管存在非凸性和约束优化,策略梯度原始-对偶方法是否能在风险约束LQR中实现全局收敛?
- RQ2对于具有二次成本和方差类约束的无限时域连续CMDP,强对偶性是否成立?
- RQ3在仿射策略参数化下,RC-LQR问题的拉格朗日函数是否具有全局梯度支配性或强制性?
- RQ4在这些条件下,是否能在模型已知和基于样本的设置中保证全局收敛?
- RQ5在基于样本的设置中,能否为对偶函数建立收敛速率?
主要发现
- RC-LQR的拉格朗日函数具有强制性,并且其梯度在局部具有Lipschitz连续性,从而能够提供全局收敛保证。
- 首次在具有二次成本的连续CMDP类中正式证明了强对偶性,这是此前在这些条件下尚未建立的新结果。
- 策略梯度原始-对偶方法在模型已知和基于样本的设置下均实现了全局收敛。
- 在基于样本的设置中,对偶函数以O(1/√k)的速率收敛,且对偶间隙被限制在O(1/√k) + O(1/k)项之内。
- 通过使用采样系统轨迹的仿真验证了所提方法的有效性和收敛性。
- 该方法通过利用拉格朗日函数的强制性和局部梯度支配性,克服了全局梯度支配性的缺失。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。