[论文解读] Perturbation-based Regret Analysis of Predictive Control in Linear Time Varying Systems
本论文首次为具有时变、良好条件成本的线性时变(LTV)系统中的预测控制提供了后悔和竞争比界限。通过一种新颖的基于扰动的分析框架,证明了模型预测控制(MPC)的动态后悔为 $ O(\lambda^k T) $,竞争比为 $ 1 + O(\lambda^k) $,其中 $ \lambda < 1 $,表明后悔随预测时域 $ k $ 呈指数衰减。
We study predictive control in a setting where the dynamics are time-varying and linear, and the costs are time-varying and well-conditioned. At each time step, the controller receives the exact predictions of costs, dynamics, and disturbances for the future $k$ time steps. We show that when the prediction window $k$ is sufficiently large, predictive control is input-to-state stable and achieves a dynamic regret of $O(λ^k T)$, where $λ< 1$ is a positive constant. This is the first dynamic regret bound on the predictive control of linear time-varying systems. Under more assumptions on the terminal costs, we also show that predictive control obtains the first competitive bound for the control of linear time-varying systems: $1 + O(λ^k)$. Our results are derived using a novel proof framework based on a perturbation bound that characterizes how a small change to the system parameters impacts the optimal trajectory.
研究动机与目标
- 为具有时变、良好条件成本的线性时变(LTV)系统中的预测控制建立非渐近性能保证——具体为动态后悔和竞争比。
- 解决现有理论对模型预测控制(MPC)在LTV系统中理解的空白,此前结果仅限于具有二次成本的线性时不变(LTI)系统。
- 开发一种新分析框架,避免显式求解最优轨迹,从而在一般成本函数和时变动态下实现分析。
- 证明即使在非二次、时变设置下,预测控制也能实现随预测窗口 $ k $ 增大而指数衰减的后悔和竞争比。
- 通过克服先前约化方法和显式代价函数方法的局限性,将现有LTI系统结果扩展至LTV系统。
提出的方法
- 提出一种基于扰动的分析框架,通过界定系统参数(动力学、成本、扰动)的微小变化对最优轨迹的影响,实现在无需显式求解最优控制律的情况下进行分析。
- 引入一种新颖的扰动界(定理3.3),刻画最优解对参数变化的敏感性,即使在非二次、良好条件成本函数下也成立。
- 将扰动界应用于推导后悔和竞争比保证,通过比较预测控制器与最优离线解的性能实现。
- 采用递归误差传播论证,利用成本的强凸性和Lipschitz连续性条件,界定了预测控制器轨迹与最优轨迹之间的累积偏差。
- 采用两阶段分析:首先界定了预测状态和控制量与最优值的偏差,然后通过强凸性和Lipschitz连续性将该偏差与总成本差异关联。
- 通过时间步长上的望远镜求和推导界,并应用涉及 $ \ell_f $、$ \ell_c $ 和系统参数的不等式,以控制误差累积。
实验结果
研究问题
- RQ1在时变线性系统中,预测控制能否实现关于预测时域 $ k $ 的可证明小动态后悔?
- RQ2在具有时变、良好条件成本的LTV系统中,能否为预测控制建立竞争比?
- RQ3能否开发一种理论框架,避免在LTV系统中显式计算最优控制律和代价函数?
- RQ4在LTV系统中,预测控制性能如何随预测窗口 $ k $ 的增加而衰减?
- RQ5在一般成本函数下,预测控制在LTV系统中可实现的最紧的后悔和竞争比如何?
主要发现
- 预测控制器实现了 $ O(\lambda^k T) $ 的动态后悔,其中 $ \lambda < 1 $ 为正常数,表明后悔随预测窗口 $ k $ 呈指数衰减。
- 在对终端成本附加假设下,控制器实现了 $ 1 + O(\lambda^k) $ 的竞争比,该比值也随 $ k $ 呈指数衰减,这是LTV系统中首次获得此类界限。
- 基于扰动的分析框架使得在无需显式表达最优轨迹或代价函数的情况下,也能获得后悔和竞争比的界。
- 界中衰减率 $ \lambda $ 由系统参数(如动力学矩阵的谱性质和成本函数的强凸性参数)决定。
- 后悔界几乎匹配LTI设置下预测改进的指数下界,仅在达到给定后悔水平所需的 $ k $ 值上相差一个常数因子。
- 该分析对非二次、良好条件成本函数具有鲁棒性,适用于具有时变动力学、扰动和成本函数的系统。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。