Skip to main content
QUICK REVIEW

[论文解读] Stochastic Finite State Control of POMDPs with LTL Specifications

Mohamadreza Ahmadi, Rangoli Sharan|arXiv (Cornell University)|Jan 21, 2020
Advanced Control Systems Optimization参考文献 33被引用 12
一句话总结

该论文提出了一种随机有界策略迭代算法,用于为部分可观察马尔可夫决策过程(POMDPs)在满足线性时序逻辑(LTL)规范的前提下,合成有限状态控制器,以最大化满足规范的概率。通过利用泊松方程和麦克克里克包络进行凸松弛,该方法实现了任意时间、可扩展的控制合成,且控制器复杂度可控增长。

ABSTRACT

Partially observable Markov decision processes (POMDPs) provide a modeling framework for autonomous decision making under uncertainty and imperfect sensing, e.g. robot manipulation and self-driving cars. However, optimal control of POMDPs is notoriously intractable. This paper considers the quantitative problem of synthesizing sub-optimal stochastic finite state controllers (sFSCs) for POMDPs such that the probability of satisfying a set of high-level specifications in terms of linear temporal logic (LTL) formulae is maximized. We begin by casting the latter problem into an optimization and use relaxations based on the Poisson equation and McCormick envelopes. Then, we propose an stochastic bounded policy iteration algorithm, leading to a controlled growth in sFSC size and an any time algorithm, where the performance of the controller improves with successive iterations, but can be stopped by the user based on time or memory considerations. We illustrate the proposed method by a robot navigation case study.

研究动机与目标

  • 解决在LTL规范下,为POMDPs合成次优随机有限状态控制器(sFSCs)的挑战,其中最优控制难以实现。
  • 在部分可观测、不确定的环境中(如机器人导航和自主系统),最大化满足复杂高层LTL规范的概率。
  • 设计一种可扩展的任意时间算法,通过迭代方式逐步提升控制器性能,同时允许用户根据时间和内存约束自定义停止条件。
  • 通过使用凸松弛和有界策略迭代,克服在LTL规范下最优POMDP控制的不可行性,实现控制器状态数的受控增长。
  • 通过初始可行控制器生成和动态添加状态到sFSC,减轻保守性,确保实际适用性。

提出的方法

  • 将LTL规范表示为确定性Rabin自动机(DRA),然后构建一个产品-POMDP,以编码系统与规范的联合动态。
  • 将sFSC设计建模为控制器中自由参数的优化问题,目标是最大化LTL满足的概率。
  • 应用泊松方程重新表述产品-POMDP中的期望奖励,从而支持动态规划技术的应用。
  • 使用麦克克里克包络对优化中出现的双线性项进行凸化,将非凸约束转换为凸松弛形式。
  • 实现一种随机有界策略迭代(BPI)算法,仅在指定子集(G^ss)中增量式地添加状态,以确保控制器复杂度受控增长。
  • 通过修改奖励函数和在产品-马尔可夫链中引入吸收状态,强制执行避免某些状态的约束,从而在优化过程中保持正确性。

实验结果

研究问题

  • RQ1如何为POMDPs合成次优随机有限状态控制器(sFSCs),以最大化满足LTL规范的概率?
  • RQ2能否设计一种可扩展的任意时间算法,用于sFSC合成,使其性能可随时间逐步提升,并支持用户自定义停止条件?
  • RQ3可采用哪些凸松弛技术来处理由控制器参数化中双线性项引起的优化问题的非凸性?
  • RQ4如何将有界策略迭代方法进行调整,以确保sFSC规模受控增长,同时保持或提升LTL满足概率?
  • RQ5在控制器合成过程中,特别是在初始可行控制器生成和状态添加阶段,应采用何种策略来减轻保守性?

主要发现

  • 所提出的随机有界策略迭代算法实现了sFSC规模的受控增长,用户可基于计算约束在任意时间点停止该过程。
  • 该方法在产品-POMDP中实现了目标集$Repeat_{0}^{ ext{PM}^{ Varepsilon}}$访问频率的单调提升,如图5所示,表明LTL满足概率得到增强。
  • 泊松方程与麦克克里克包络的结合成功地将非凸优化问题凸化,使得通过有界策略迭代可高效且可扩展地求解。
  • 通过引入吸收状态和基于奖励的约束,该算法在优化过程中保持了正确性,确保某些状态(如$Avoid_{ rak{r}}^{ Varepsilon}$)永远不会被访问。
  • 该方法为原本在LTL规范下POMDP有限记忆策略合成的EXPTIME完全问题提供了实用解决方案,且保证收敛至性能更优的控制器。
  • 机器人导航案例研究证明了该方法在真实场景中的有效性,表明每向sFSC增加一个状态,LTL满足概率均有可测量的提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。