[论文解读] Game representations for state constrained continuous time linear regulator problems
本文通过将障碍函数表示为二次函数的上确界,提出了连续时间线性二次调节器(LQR)问题在凸状态约束下的博弈论重构。关键贡献在于证明了带约束的LQR问题等价于一个无约束的双人零和博弈,从而可通过Riccati型方程实现状态反馈最优控制策略,并证明了上、下博弈值的等价性,确保了计算上的可行性。
A supremum-of-quadratics representation for convex barrier-type constraints is developed and applied within the context of a class of continuous time state constrained linear regulator problems. Using this representation, it is shown that a linear regulator problem subjected to such a convex barrier-type constraint can be equivalently formulated as an unconstrained two-player linear quadratic game. By demonstrating equivalence of the upper and lower values of this game, state feedback characterizations for the optimal policies of both players are developed. These characterizations are subsequently illustrated by example.
研究动机与目标
- 为解决连续时间线性二次调节器(LQR)问题中凸状态约束带来的挑战,此类约束破坏了标准的二次结构,导致哈密顿-雅可比-贝尔曼(HJB)偏微分方程变为非二次且难以求解。
- 通过引入障碍函数的上确界-二次表示法实现凸松弛,以克服约束LQR问题中的维数灾难和计算不可行性。
- 建立原始约束LQR问题与无约束双人线性二次博弈之间的等价性,从而可利用博弈论工具进行最优控制综合。
- 推导博弈中双方最优策略的状态反馈表征,确保约束满足并收敛至原始问题的解。
提出的方法
- 将凸障碍函数表示为实参数索引的二次惩罚族的上确界,从而实现状态相关的二次惩罚,以逼近非二次约束。
- 引入精确的上确界-二次表示法,其中惩罚参数可趋于无穷大以强制执行状态约束;同时引入参数区间有界的近似版本,以保证计算可行性。
- 将约束LQR问题重构为无约束的双人零和博弈,其中最小化玩家控制动态系统,最大化玩家选择惩罚参数以强制执行约束。
- 证明博弈的上值与下值相等,确保博弈值的存在性,并支持动态规划原理的应用。
- 通过求解来自博弈哈密顿-雅可比-贝尔曼方程的微分Riccati方程(DRE),推导出双方的最优状态反馈策略。
- 利用可测选择与Fenchel对偶性,证明最优反馈律的存在性,并证明值函数的连续性与凸性。
实验结果
研究问题
- RQ1连续时间LQR问题中的凸状态约束能否被重构为等价的无约束双人博弈?
- RQ2障碍函数的上确界-二次表示法是否能保持原始约束问题的最优值与轨迹行为?
- RQ3能否建立上值与下值的等价性,以确保博弈值的存在性并支持计算求解策略?
- RQ4如何在博弈构型中推导出双方的最优状态反馈控制策略?
- RQ5当惩罚参数上界增大时,近似博弈构型的收敛行为如何,其是否趋近于精确的约束LQR问题?
主要发现
- 凸障碍函数的精确上确界-二次表示法确保最优状态轨迹始终被限制在闭约束球内,且以几乎必然的方式保持在内部。
- 当惩罚参数的上界趋于无穷大时,近似博弈构型在值函数与最优轨迹方面均收敛至精确问题。
- 双人博弈的上值与下值相等,保证了博弈值的存在性,并支持利用动态规划进行策略综合。
- 双方的最优反馈策略可通过求解微分Riccati方程(DRE)显式表征,从而实现高效计算。
- 博弈的值函数是凸的且下半连续,其Fenchel变换可显式计算,从而将障碍函数与惩罚参数空间联系起来。
- 控制玩家的最优策略依赖于DRE的解,而对手的策略则根据当前状态选择惩罚参数,从而确保约束被强制执行。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。