[论文解读] The Minkowski-Bellman Equation
本文为具有阶段成本和终端成本作为适当C-集的闵可夫斯基函数的无约束线性离散时间系统,在有限和无限时域最优控制中引入了闵可夫斯基-贝尔曼方程。它建立了贝尔曼迭代的适定性、固定点值函数的唯一性以及优化器映射的收敛性,通过非光滑和变分分析工具与集值动力学,为非二次、类似范数的成本函数提供了线性二次调节器的新类比。
This manuscript studies the Minkowski-Bellman equation, which is the Bellman equation arising from finite or infinite horizon optimal control of unconstrained linear discrete time systems with stage and terminal cost functions specified as Minkowski functions of proper C-sets. In regards to the finite horizon optimal control, it is established that, under natural conditions, the Minkowski-Bellman equation and its iteration are well posed. The characterization of the value functions and optimizer maps is derived. In regards to the infinite horizon optimal control, it is demonstrated that, under the same natural conditions, the fixed point of the Minkowski-Bellman equation is unique, in terms of the value function, over the space of Minkowski functions of proper C-sets. The characterization of the fixed point value function and optimizer map is reported.
研究动机与目标
- 为无约束线性离散时间系统在非二次、类似范数的成本函数下缺乏闭式解的问题提供解决方案。
- 表征阶段和终端成本为适当C-集的闵可夫斯基函数的有限和无限时域最优控制问题的值函数和优化器映射。
- 在自然条件下建立闵可夫斯基-贝尔曼方程迭代的适定性。
- 证明在适当C-集的闵可夫斯基函数空间中,闵可夫斯基-贝尔曼方程的固定点存在且唯一。
- 展示在无限时域情况下优化器映射及其选择的统一收敛性。
提出的方法
- 将闵可夫斯基-贝尔曼方程表述为阶段和终端成本定义为适当C-集的闵可夫斯基函数的系统的贝尔曼方程。
- 使用集值分析和集动态方法,将值函数和优化器映射表征为演化集合的闵可夫斯基函数。
- 应用非光滑和变分分析工具,包括支撑函数和规范函数,以表征值函数和控制策略的演化。
- 通过嵌套包含和位似性论证,建立表示值函数和控制策略的集合序列的收敛性。
- 采用规范函数和支撑函数形式化,证明优化器映射及其最小范数选择在单位球面上的统一收敛性。
- 使用递归集动态定义值函数和控制策略所依赖集合的演化,确保适当C-集不变性及收敛性。
实验结果
研究问题
- RQ1在具有闵可夫斯基函数成本的无约束线性离散时间系统中,闵可夫斯基-贝尔曼方程在有限时域最优控制下是否适定?
- RQ2在无限时域情况下,闵可夫斯基-贝尔曼方程的固定点是否存在于适当C-集的闵可夫斯基函数空间中,且唯一?
- RQ3在无限时域设置下,优化器映射及其最小范数选择是否统一收敛?
- RQ4在贝尔曼迭代下,值函数和控制策略能否表征为演化适当C-集的闵可夫斯基函数?
- RQ5在无限时域情况下,表示值函数和控制策略的集合序列的收敛行为如何?
主要发现
- 在自然条件下,闵可夫斯基-贝尔曼方程及其迭代是适定的,每一步迭代中值函数均为适当C-集的闵可夫斯基函数。
- 在无限时域情况下,闵可夫斯基-贝尔曼方程在适当C-集的闵可夫斯基函数空间中存在唯一固定点。
- 固定点处的值函数表征为适当C-集的闵可夫斯基函数,相应的优化器映射通过涉及规范函数的集值映射表征。
- 定义值函数和控制策略的集合序列以嵌套、位似的方式收敛至其极限,确保优化器映射的统一收敛性。
- 优化器映射 $ u_k(\bullet) $ 及其最小范数选择 $ \nu_k(\bullet) $ 在单位球面上一致收敛至无限时域优化器映射 $ u_\bullet(\bullet) $ 及其选择 $ \nu_\bullet(\bullet) $。
- 收敛性通过依赖于 $ \tau_1 $ 的误差界量化,表明对任意 $ \varepsilon > 0 $,存在 $ k^* $,使得集合 $ \mathcal{P}_k $ 和 $ \mathcal{T}_k $ 在豪斯多夫度量下位于其极限的 $ \varepsilon $-邻域内。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。