Skip to main content
QUICK REVIEW

[论文解读] Infinite-horizon Linear Optimal Control of Markov Jump Systems without Mode Observation via State Feedback

Maxim Dolgov, Uwe D. Hanebeck|arXiv (Cornell University)|Jan 1, 2015
Stability and Control of Uncertain Systems参考文献 24被引用 4
一句话总结

本文针对无模式观测的马尔可夫跳跃线性系统(MJLS)提出了一种无限时域线性最优控制律,采用状态反馈与固定增益线性控制。通过必要最优性条件与迭代算法计算稳定增益,实现接近滚动时域方法的性能,且无需时域调参或在线重优化。

ABSTRACT

In this paper, we consider stochastic optimal control of Markov Jump Linear Systems with state feedback but without observation of the jumping parameter. The proposed control law is assumed to be linear with constant gains that can be obtained from the necessary optimality conditions using an iterative algorithm. The proposed approach is demonstrated in a numerical example.

研究动机与目标

  • 针对跳跃模式不可观测这一常见情形下,解决马尔可夫跳跃线性系统最优控制的挑战,此时最优解通常计算上不可行。
  • 设计一种时不变、固定增益的线性控制律,以最小化无限时域代价函数,避免依赖滚动时域框架或时域参数选择。
  • 通过从汉密尔顿-雅可比-贝尔曼方程推导必要条件,并利用迭代算法求解,确保控制律的稳定性和最优性。
  • 证明所提控制器在结构简单且固定的前提下,性能几乎与时变滚动时域控制器相当。

提出的方法

  • 将MJLS的动力学建模为依赖模式的矩阵 A_θ, B_θ, H_θ,以及具有协方差 W 的独立同分布零均值高斯噪声。
  • 定义涉及依赖模式的半正定 Q_θ 与正定 R_θ 矩阵的无限时域平均代价函数。
  • 施加控制律为线性且增益固定的结构假设,从而可应用必要最优性条件,推导出不动点方程。
  • 利用克罗内克积与向量化算子,将耦合的里卡蒂型方程转化为向量化形式,得到线性系统 ψ_k+1 = M ψ_k + ρ_k 的形式。
  • 通过确保矩阵 M 的谱半径小于 1,建立压缩映射原理,保证唯一不动点的存在与收敛性。
  • 采用谱半径的光滑凸近似(通过 μ_ε(A))求解可 stabilizability 测试并优化控制器增益,实现基于梯度的优化。

实验结果

研究问题

  • RQ1当模式不可观测时,时不变、固定增益的线性控制器是否能在无限时域MJLS控制中实现近似最优性能?
  • RQ2是否可能在不依赖滚动时域框架或选择有限优化时域的前提下,计算最优控制增益?
  • RQ3在假设无法观测模式的前提下,如何保证最优控制律的稳定性和收敛性?
  • RQ4系统矩阵 M 的谱半径与迭代算法中唯一不动点存在的关系是什么?
  • RQ5在缺乏模式信息的情况下,谱半径的光滑凸近似是否能实现控制器增益的高效且稳定优化?

主要发现

  • 所提控制器在性能上几乎与先前研究中时变滚动时域控制器相当,尽管其采用固定增益且无需时域参数。
  • 由于系统矩阵 M 的谱半径小于 1,迭代算法收敛至唯一不动点,其本质为压缩映射。
  • 可 stabilizability 测试被表述为最小化矩阵 M 谱半径的优化问题,从而确保闭环系统的均方稳定。
  • 使用谱半径的光滑凸近似 μ_ε(A) 可实现基于梯度的优化,且当 ε → 0 时收敛至真实谱半径。
  • 通过假设线性控制律,避免了维度灾难与双重效应复杂性,使方法在计算上可行,同时保持高性能。
  • 数值结果证实控制器增益收敛,代价函数稳定,验证了该方法在实际MJLS示例中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。