Skip to main content
QUICK REVIEW

[论文解读] Stochastic control up to a hitting time: optimality and rolling-horizon implementation

Debasish Chatterjee, Eugenio Cinquemani|ArXiv.org|Jun 18, 2008
Advanced Control Systems Optimization参考文献 32被引用 6
一句话总结

本文提出一种动态规划方法,用于在不假设目标集为吸收态的前提下,针对紧致目标集的首次 hitting 时间的随机最优控制问题。通过压缩映射原理,建立了最优策略的存在性与唯一性;提出了带有可量化次优性界别的滚动时域近似方法;并在成本与状态动态的温和增长条件下,证明了价值迭代的渐近折扣最优性。

ABSTRACT

We present a dynamic programming-based solution to a stochastic optimal control problem up to a hitting time for a discrete-time Markov control process. Firstly, we determine an optimal control policy to steer the process toward a compact target set while simultaneously minimizing an expected discounted cost. We then provide a rolling-horizon strategy for approximating the optimal policy, together with quantitative characterization of its sub-optimality with respect to the optimal policy. Finally, we address related issues of asymptotic discount-optimality of the value-iteration policy. Both the state and action spaces are assumed to be Polish.

研究动机与目标

  • 填补在具有无界噪声与硬约束的系统中,随机模型预测控制(MPC)缺乏理论基础的问题。
  • 为在波兰空间上的离散时间马尔可夫控制系统中,实现向紧致目标集的首次 hitting 时间最优控制,构建一个无需目标集为吸收态的框架。
  • 提供一种滚动时域实施策略,相对于最优策略具有可量化的性能保证。
  • 在成本与状态动态的温和增长率条件下,建立价值迭代的渐近折扣最优性。
  • 通过将硬约束放松为概率约束,同时确保通过最优控制策略实现快速恢复,从而支持实际 MPC 设计。

提出的方法

  • 将问题表述为在离散时间马尔可夫控制系统中,最小化状态首次击中紧致目标集前的期望折扣成本,定义于波兰空间上。
  • 在标准温和假设下推导出价值函数的贝尔曼方程,证明存在确定性平稳最优策略。
  • 在成本与状态动态的增长率条件下,应用压缩映射论证,建立最优价值函数的存在性与唯一性。
  • 提出一种滚动时域策略,每一步求解一个有限时域最优控制问题,采用长度为 $N$ 的前向时域。
  • 通过折扣因子 $\alpha$、增长率 $\gamma < 1$ 以及一个类似李雅普诺夫的函数 $w(x)$,量化滚动时域策略的次优性。
  • 利用错位级数与条件期望论证,推导出滚动时域策略与最优策略之间期望成本差的上界。

实验结果

研究问题

  • RQ1当目标集非吸收态时,是否可保证首次 hitting 时间随机控制问题存在最优控制策略?
  • RQ2如何设计滚动时域近似方法,以确保相对于最优策略的次优性有界?
  • RQ3在何种成本与状态动态条件下,可保证此设定下价值迭代的收敛性与稳定性?
  • RQ4在非吸收目标的滚动时域 MPC 框架中,性能与计算复杂度之间的权衡如何量化?
  • RQ5在 hitting 时间控制背景下,价值迭代策略在何种条件下是渐近折扣最优的?

主要发现

  • 即使目标集非吸收态,首次 hitting 时间的随机控制问题仍存在最优确定性平稳策略。
  • 最优价值函数满足一个贝尔曼方程,其涉及状态空间子集上的积分,反映了目标集的非吸收特性。
  • 在成本与状态动态的温和增长率条件下,最优价值函数唯一,且可通过价值迭代获得。
  • 滚动时域策略的次优性间隙被有界于 $\frac{\overline{c}\gamma^{N+1}}{1-\gamma}w(x)$,其中 $\overline{c}$ 为成本上界,$\gamma < 1$ 为增长率,$w(x)$ 为类似李雅普诺夫的函数。
  • 价值迭代策略是渐近折扣最优的,即其性能随折扣因子 $\alpha \to 1$ 而趋近于最优策略性能。
  • 该理论框架通过支持概率约束与恢复策略,保障在违反约束后能快速返回安全集,从而支持实际 MPC 设计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。