Skip to main content
QUICK REVIEW

[论文解读] Control Design for Markov Chains under Safety Constraints: A Convex Approach

Eduardo R. Arvelo, Nuno C. Martins|arXiv (Cornell University)|Sep 13, 2012
Advanced Control Systems Optimization参考文献 14被引用 4
一句话总结

本文提出一种凸优化方法,用于在安全约束下设计有限状态马尔可夫链的时间不变、无记忆控制策略,确保永不进入禁止状态。通过构建一个有限参数化的最大熵优化程序,该方法可高效识别出最大的安全常返状态集合,且可使用标准凸优化求解器快速计算。

ABSTRACT

This paper focuses on the design of time-invariant memoryless control policies for fully observed controlled Markov chains, with a finite state space. Safety constraints are imposed through a pre-selected set of forbidden states. A state is qualified as safe if it is not a forbidden state and the probability of it transitioning to a forbidden state is zero. The main objective is to obtain control policies whose closed loop generates the maximal set of safe recurrent states, which may include multiple recurrent classes. A design method is proposed that relies on a finitely parametrized convex program inspired on entropy maximization principles. A numerical example is provided and the adoption of additional constraints is discussed.

研究动机与目标

  • 设计控制策略,以在确保不进入预定义禁止状态集合的前提下,最大化受控马尔可夫链中的常返状态数量。
  • 在时间不变、无记忆控制策略下,刻画既是常返又是安全(即无法到达禁止状态)的状态的最大集合。
  • 开发一种计算上可行的方法,利用凸规划识别此类控制策略。
  • 通过利用最大熵优化原理和标准凸优化工具,确保解的鲁棒性与可扩展性。
  • 将框架扩展以纳入额外约束(如期望成本或资源限制),同时保持凸性。

提出的方法

  • 将控制设计问题表述为一个凸优化问题,通过在约束条件下最大化状态-控制联合分布的联合熵来实现。
  • 采用有限参数化形式,其中优化变量为每个状态处的控制策略概率。
  • 施加约束条件,确保从解集中任意状态出发,进入禁止状态的概率恰好为零。
  • 将闭环马尔可夫链的平稳分布作为关键组件,用于验证常返性与安全性。
  • 推导出对偶形式,将最优解与平稳分布的支集联系起来,从而识别出最大安全常返集合。
  • 引入一种改进的熵目标函数,专注于状态边缘分布,以降低计算复杂度,同时保持相同的支集。

实验结果

研究问题

  • RQ1在时间不变、无记忆控制策略下,受控马尔可夫链中可实现的安全常返状态的最大集合是什么?
  • RQ2该最大安全常返集合能否通过凸优化框架系统性地计算得出?
  • RQ3如何利用最大熵优化原理设计控制策略,以实现最大安全常返性?
  • RQ4引入额外凸约束(如对期望控制成本的约束)对解的结构与可行性有何影响?
  • RQ5所提方法是否在强制安全的同时,保持了实现常返性所必需的平稳分布结构?

主要发现

  • 最大安全常返状态集合 $\mathbb{X}_{\mathbb{F}}^{R}$ 定义良好且可通过合适的控制策略实现。
  • 基于最大熵优化的所提凸规划,其解的支集恰好对应于 $\mathbb{X}_{\mathbb{F}}^{R}$,确保该集合中所有状态均为常返且安全。
  • 最优控制策略 $\mathcal{K}^{*}_{R}$ 可通过公式 (5) 从凸规划的最优解推导得出,保证闭环链具有最大安全常返集合。
  • 一种改进的凸规划,其目标函数为最大化状态边缘分布的熵而非联合分布,可得到相同的支集 $\mathbb{S}_{f^{*}_{X}}$,从而在保持解不变的同时降低计算成本。
  • 可将额外的凸约束(如 $\sum h(u)f_{XU}(x,u) \leq \beta$)纳入优化问题而不破坏凸性,且可对 $h(U_k)$ 的时间期望值施加上界。
  • 当安全常返集合仅包含一个非周期类时,无论初始分布如何,任意函数 $h(U_k)$ 的长期期望值均被 $\beta$ 所限制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。