[论文解读] On Time-Consistent Solution to Time-Inconsistent Linear-Quadratic Optimal Control of Discrete-Time Stochastic Systems
本文提出了一种用于离散时间随机线性二次最优控制问题中时间不一致目标的时间一致解法。通过最大值原理类型的必要与充分条件,引入了开环均衡控制和线性反馈均衡策略,并建立了其与广义差分Riccati方程(GDREs)和线性差分方程(LDEs)可解性的等价关系。
In this paper, we investigate a class of time-inconsistent discrete-time stochastic linear-quadratic optimal control problems, whose time-consistent solutions consist of an open-loop equilibrium control and a linear feedback equilibrium strategy. The open-loop equilibrium control is defined for a given initial pair, while the linear feedback equilibrium strategy is defined for all the initial pairs. Maximum-principle-type necessary and sufficient conditions containing stationary and convexity are derived for the existence of these two time-consistent solutions, respectively. Furthermore, for the case where the system matrices are independent of the initial time, we show that the existence of the open-loop equilibrium control for a given initial pair is equivalent to the solvability of a set of nonsymmetric generalized difference Riccati equations and a set of linear difference equations. Moreover, the existence of linear feedback equilibrium strategy is equivalent to the solvability of another set of symmetric generalized difference Riccati equations.
研究动机与目标
- 解决标准动态规划失效的离散时间随机线性二次(LQ)最优控制问题中的时间不一致性问题。
- 为开环均衡控制和线性反馈均衡策略建立时间一致的框架。
- 利用最大值原理类型的标准,建立这些均衡解存在的必要与充分条件。
- 当系统矩阵为时不变时,通过广义差分Riccati方程(GDREs)和线性差分方程(LDEs)表征解。
- 为实际在随机控制系统中实现,提供一种系统化方法以计算均衡策略。
提出的方法
- 为给定初始对定义开环均衡控制,并为所有初始对定义线性反馈均衡策略。
- 推导涉及平稳性和凸性的最大值原理类型必要与充分条件,以确保均衡的存在。
- 对于时不变系统矩阵,证明开环均衡控制存在的充要条件是特定非对称GDREs和LDEs可解。
- 证明线性反馈均衡策略存在的充要条件是特定对称GDREs可解。
- 利用前向-后向随机差分方程(FBSDEs)建模最优性系统中的状态和伴随过程。
- 采用向后递推法求解GDREs和LDEs,从而计算反馈增益和均衡控制。
实验结果
研究问题
- RQ1在离散时间随机LQ问题中,给定初始对时,时间一致的开环均衡控制在何种条件下存在?
- RQ2在所有初始对下均有效的线性反馈均衡策略在何种条件下存在?
- RQ3如何通过广义差分Riccati方程(GDREs)和线性差分方程(LDEs)表征均衡解的存在性?
- RQ4时间不一致LQ问题与对称及非对称GDREs可解性之间存在何种关系?
- RQ5所提出的框架能否扩展至具有时变或马氏调制参数的系统?
主要发现
- 给定初始对的开环均衡控制存在性,等价于一组非对称广义差分Riccati方程(GDREs)和一组线性差分方程(LDEs)的可解性。
- 线性反馈均衡策略的存在性,等价于一组对称广义差分Riccati方程(GDREs)的可解性。
- 数值示例验证了所推导的GDREs和LDEs的可解性,正定矩阵(如 $\widetilde{W}_{1,1} > 0$,$\widetilde{W}_{0,0} > 0$)验证了条件的有效性。
- 在示例5.2和5.3中,显式计算出反馈增益矩阵 $\Phi_0, \Phi_1, \Phi_2$ 和 $\Phi_0, \Phi_1$,展示了均衡策略的实际计算过程。
- 该框架可处理不定甚至负定的控制加权矩阵(如 $R_{0,0}$ 不定,$R_{0,1}$ 负定),突破了经典LQ理论的限制。
- 结果通过提供时间一致解,推广了经典动态规划,即使在贝尔曼原理下最优控制为时间不一致时亦成立。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。