[论文解读] Stochastic control up to a hitting time: optimality and rolling-horizon implementation
本文提出一种动态规划方法,用于在不假设目标集为吸收态的前提下,针对紧致目标集的首次 hitting 时间的随机最优控制问题。通过压缩映射原理,建立了最优策略的存在性与唯一性;提出了带有可量化次优性界别的滚动时域近似方法;并在成本与状态动态的温和增长条件下,证明了价值迭代的渐近折扣最优性。
We present a dynamic programming-based solution to a stochastic optimal control problem up to a hitting time for a discrete-time Markov control process. Firstly, we determine an optimal control policy to steer the process toward a compact target set while simultaneously minimizing an expected discounted cost. We then provide a rolling-horizon strategy for approximating the optimal policy, together with quantitative characterization of its sub-optimality with respect to the optimal policy. Finally, we address related issues of asymptotic discount-optimality of the value-iteration policy. Both the state and action spaces are assumed to be Polish.
研究动机与目标
- 填补在具有无界噪声与硬约束的系统中,随机模型预测控制(MPC)缺乏理论基础的问题。
- 为在波兰空间上的离散时间马尔可夫控制系统中,实现向紧致目标集的首次 hitting 时间最优控制,构建一个无需目标集为吸收态的框架。
- 提供一种滚动时域实施策略,相对于最优策略具有可量化的性能保证。
- 在成本与状态动态的温和增长率条件下,建立价值迭代的渐近折扣最优性。
- 通过将硬约束放松为概率约束,同时确保通过最优控制策略实现快速恢复,从而支持实际 MPC 设计。
提出的方法
- 将问题表述为在离散时间马尔可夫控制系统中,最小化状态首次击中紧致目标集前的期望折扣成本,定义于波兰空间上。
- 在标准温和假设下推导出价值函数的贝尔曼方程,证明存在确定性平稳最优策略。
- 在成本与状态动态的增长率条件下,应用压缩映射论证,建立最优价值函数的存在性与唯一性。
- 提出一种滚动时域策略,每一步求解一个有限时域最优控制问题,采用长度为 $N$ 的前向时域。
- 通过折扣因子 $\alpha$、增长率 $\gamma < 1$ 以及一个类似李雅普诺夫的函数 $w(x)$,量化滚动时域策略的次优性。
- 利用错位级数与条件期望论证,推导出滚动时域策略与最优策略之间期望成本差的上界。
实验结果
研究问题
- RQ1当目标集非吸收态时,是否可保证首次 hitting 时间随机控制问题存在最优控制策略?
- RQ2如何设计滚动时域近似方法,以确保相对于最优策略的次优性有界?
- RQ3在何种成本与状态动态条件下,可保证此设定下价值迭代的收敛性与稳定性?
- RQ4在非吸收目标的滚动时域 MPC 框架中,性能与计算复杂度之间的权衡如何量化?
- RQ5在 hitting 时间控制背景下,价值迭代策略在何种条件下是渐近折扣最优的?
主要发现
- 即使目标集非吸收态,首次 hitting 时间的随机控制问题仍存在最优确定性平稳策略。
- 最优价值函数满足一个贝尔曼方程,其涉及状态空间子集上的积分,反映了目标集的非吸收特性。
- 在成本与状态动态的温和增长率条件下,最优价值函数唯一,且可通过价值迭代获得。
- 滚动时域策略的次优性间隙被有界于 $\frac{\overline{c}\gamma^{N+1}}{1-\gamma}w(x)$,其中 $\overline{c}$ 为成本上界,$\gamma < 1$ 为增长率,$w(x)$ 为类似李雅普诺夫的函数。
- 价值迭代策略是渐近折扣最优的,即其性能随折扣因子 $\alpha \to 1$ 而趋近于最优策略性能。
- 该理论框架通过支持概率约束与恢复策略,保障在违反约束后能快速返回安全集,从而支持实际 MPC 设计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。