[论文解读] Policy Optimization for Markovian Jump Linear Quadratic Control: Gradient-Based Methods and Global Convergence
本文建立了基于梯度的策略优化方法——梯度下降、高斯-牛顿法和自然策略梯度——在马氏跳跃线性二次(MJLS)控制中的全局收敛性。尽管该问题具有非凸性,但当以均方稳定控制器初始化时,本文证明了线性收敛至最优状态反馈控制器,其理论依据在于优化景观中具备的共轭性、梯度主导性和近似光滑性等性质。
Recently, policy optimization for control purposes has received renewed attention due to the increasing interest in reinforcement learning. In this paper, we investigate the global convergence of gradient-based policy optimization methods for quadratic optimal control of discrete-time Markovian jump linear systems (MJLS). First, we study the optimization landscape of direct policy optimization for MJLS, with static state feedback controllers and quadratic performance costs. Despite the non-convexity of the resultant problem, we are still able to identify several useful properties such as coercivity, gradient dominance, and almost smoothness. Based on these properties, we show global convergence of three types of policy optimization methods: the gradient descent method; the Gauss-Newton method; and the natural policy gradient method. We prove that all three methods converge to the optimal state feedback controller for MJLS at a linear rate if initialized at a controller which is mean-square stabilizing. Some numerical examples are presented to support the theory. This work brings new insights for understanding the performance of policy gradient methods on the Markovian jump linear quadratic control problem.
研究动机与目标
- 理解策略优化方法在马氏跳跃线性系统(MJLS)这一类具有马氏调制动态的混合系统中的理论性能。
- 将既有的策略梯度方法收敛理论——此前仅在LQR等线性时不变(LTI)系统中建立——扩展至更复杂的MJLS场景。
- 识别MJLS策略优化景观中的结构性质,如共轭性、梯度主导性和近似光滑性,这些性质可支持全局收敛性保证。
- 针对三种关键策略优化方法——梯度下降、高斯-牛顿法和自然策略梯度——在稳定初始化条件下的收敛性提供分析。
- 通过不同规模和模式数的系统上的数值实验,验证理论发现,展示一致的收敛行为。
提出的方法
- 分析具有静态状态反馈和二次代价的MJLS直接策略优化的优化景观,识别关键结构性质:共轭性、梯度主导性和近似光滑性。
- 利用这些性质推导收敛保证,证明梯度下降、高斯-牛顿法和自然策略梯度方法均具有线性收敛速率。
- 证明若以均方稳定控制器初始化,所有三种方法均可全局收敛至最优控制器。
- 通过类似李雅普诺夫的论证和递归误差界,表明代价单调递减并线性收敛至最优值。
- 提出无需模型的实现方式,通过采样轨迹估计策略梯度和费雪信息,使方法可应用于未知MJLS。
- 在含100个和1000个状态的系统上开展数值实验,验证理论收敛速率,并比较不同方法的性能。
实验结果
研究问题
- RQ1尽管问题具有非凸性,基于梯度的策略优化方法是否能在MJLS控制中实现全局收敛?
- RQ2MJLS策略优化景观中的哪些结构性质——如共轭性、梯度主导性和近似光滑性——可实现全局收敛?
- RQ3在MJLS场景中,高斯-牛顿法和自然策略梯度法是否比标准梯度下降收敛更快?
- RQ4当以均方稳定控制器初始化时,MJLS中策略优化的全局收敛性是否可保证?
- RQ5所提出的方法能否通过采样轨迹实现无模型化,其对收敛性有何影响?
主要发现
- 三种策略优化方法——梯度下降、高斯-牛顿法和自然策略梯度——均能对MJLS实现全局收敛至最优状态反馈控制器。
- 当初始控制器为均方稳定时,收敛速率呈线性,其理论证明基于共轭性和梯度主导性。
- 在数值实验中,高斯-牛顿法的收敛速度显著快于梯度下降和自然策略梯度方法。
- 自然策略梯度和标准策略梯度方法对步长选择较敏感,而高斯-牛顿法因采用海森矩阵近似,对步长不敏感。
- 在含100个和1000个状态的系统上的数值结果验证了理论收敛趋势,且模式数较少的系统收敛更快。
- 无模型实现是可行的,只要梯度估计足够准确,通过足够多的轨迹采样即可实现预期效果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。