[论文解读] Control Design for Markov Chains under Safety Constraints: A Convex Approach
本文提出一种凸优化方法,用于在安全约束下设计有限状态马尔可夫链的时间不变、无记忆控制策略,确保永不进入禁止状态。通过构建一个有限参数化的最大熵优化程序,该方法可高效识别出最大的安全常返状态集合,且可使用标准凸优化求解器快速计算。
This paper focuses on the design of time-invariant memoryless control policies for fully observed controlled Markov chains, with a finite state space. Safety constraints are imposed through a pre-selected set of forbidden states. A state is qualified as safe if it is not a forbidden state and the probability of it transitioning to a forbidden state is zero. The main objective is to obtain control policies whose closed loop generates the maximal set of safe recurrent states, which may include multiple recurrent classes. A design method is proposed that relies on a finitely parametrized convex program inspired on entropy maximization principles. A numerical example is provided and the adoption of additional constraints is discussed.
研究动机与目标
- 设计控制策略,以在确保不进入预定义禁止状态集合的前提下,最大化受控马尔可夫链中的常返状态数量。
- 在时间不变、无记忆控制策略下,刻画既是常返又是安全(即无法到达禁止状态)的状态的最大集合。
- 开发一种计算上可行的方法,利用凸规划识别此类控制策略。
- 通过利用最大熵优化原理和标准凸优化工具,确保解的鲁棒性与可扩展性。
- 将框架扩展以纳入额外约束(如期望成本或资源限制),同时保持凸性。
提出的方法
- 将控制设计问题表述为一个凸优化问题,通过在约束条件下最大化状态-控制联合分布的联合熵来实现。
- 采用有限参数化形式,其中优化变量为每个状态处的控制策略概率。
- 施加约束条件,确保从解集中任意状态出发,进入禁止状态的概率恰好为零。
- 将闭环马尔可夫链的平稳分布作为关键组件,用于验证常返性与安全性。
- 推导出对偶形式,将最优解与平稳分布的支集联系起来,从而识别出最大安全常返集合。
- 引入一种改进的熵目标函数,专注于状态边缘分布,以降低计算复杂度,同时保持相同的支集。
实验结果
研究问题
- RQ1在时间不变、无记忆控制策略下,受控马尔可夫链中可实现的安全常返状态的最大集合是什么?
- RQ2该最大安全常返集合能否通过凸优化框架系统性地计算得出?
- RQ3如何利用最大熵优化原理设计控制策略,以实现最大安全常返性?
- RQ4引入额外凸约束(如对期望控制成本的约束)对解的结构与可行性有何影响?
- RQ5所提方法是否在强制安全的同时,保持了实现常返性所必需的平稳分布结构?
主要发现
- 最大安全常返状态集合 $\mathbb{X}_{\mathbb{F}}^{R}$ 定义良好且可通过合适的控制策略实现。
- 基于最大熵优化的所提凸规划,其解的支集恰好对应于 $\mathbb{X}_{\mathbb{F}}^{R}$,确保该集合中所有状态均为常返且安全。
- 最优控制策略 $\mathcal{K}^{*}_{R}$ 可通过公式 (5) 从凸规划的最优解推导得出,保证闭环链具有最大安全常返集合。
- 一种改进的凸规划,其目标函数为最大化状态边缘分布的熵而非联合分布,可得到相同的支集 $\mathbb{S}_{f^{*}_{X}}$,从而在保持解不变的同时降低计算成本。
- 可将额外的凸约束(如 $\sum h(u)f_{XU}(x,u) \leq \beta$)纳入优化问题而不破坏凸性,且可对 $h(U_k)$ 的时间期望值施加上界。
- 当安全常返集合仅包含一个非周期类时,无论初始分布如何,任意函数 $h(U_k)$ 的长期期望值均被 $\beta$ 所限制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。