Skip to main content
QUICK REVIEW

[论文解读] Supervisor Synthesis of POMDP based on Automata Learning

Xiaobin Zhang, Bo Wu|arXiv (Cornell University)|Mar 24, 2017
Formal Methods in Verification参考文献 37被引用 4
一句话总结

本文提出了一种基于L*-学习的监督器合成框架,用于部分可观察马尔可夫决策过程(POMDPs),利用一种专门的确定性有限自动机(za-DFA)来强制执行有限时域的概率计算树逻辑(PCTL)规范。该方法通过迭代地通过成员查询和反例驱动学习来细化za-DFA,自动合成一个宽松且非阻塞的监督器,实现了具有保证终止的可靠且完备的合成。

ABSTRACT

As a general and thus popular model for autonomous systems, partially observable Markov decision process (POMDP) can capture uncertainties from different sources like sensing noises, actuation errors, and uncertain environments. However, its comprehensiveness makes the planning and control in POMDP difficult. Traditional POMDP planning problems target to find the optimal policy to maximize the expectation of accumulated rewards. But for safety critical applications, guarantees of system performance described by formal specifications are desired, which motivates us to consider formal methods to synthesize supervisor for POMDP. With system specifications given by Probabilistic Computation Tree Logic (PCTL), we propose a supervisory control framework with a type of deterministic finite automata (DFA), za-DFA, as the controller form. While the existing work mainly relies on optimization techniques to learn fixed-size finite state controllers (FSCs), we develop an $L^*$ learning based algorithm to determine both space and transitions of za-DFA. Membership queries and different oracles for conjectures are defined. The learning algorithm is sound and complete. An example is given in detailed steps to illustrate the supervisor synthesis algorithm.

研究动机与目标

  • 为解决在安全关键应用中合成能够保证满足形式化PCTL规范的POMDPs监督器的挑战。
  • 克服传统基于优化的有限状态控制器(FSC)学习的局限性,实现控制器结构与转移的自动发现。
  • 开发一种可靠且完备的学习框架,无需预先知晓控制器大小,即可合成一个宽松的za-DFA监督器。
  • 通过修改POMCP和L*算法以适用于POMDPs,将概率模型检测与自动机学习相结合。
  • 通过新颖的成员查询、假设验证和反例处理的预言机,确保终止性和正确性。

提出的方法

  • 该框架使用一种专门的确定性有限自动机(za-DFA)作为监督器,用于编码POMDPs的历史相关控制策略。
  • 将L*-学习算法适配为通过发出成员查询并处理来自三个预言机的反例来推断za-DFA结构:OracleP(POMDP模型检测)、OracleB(信念状态满足性)和OracleS(PCTL的反例选择)。
  • 通过修改POMCP算法,计算在有限时域内满足PCTL公式的最大概率,从而加速POMDP模型检测步骤。
  • 通过迭代扩展和细化L*中的观察表,以保持闭合性和一致性,确保可靠且完备的学习。
  • 利用反例来细化推测的za-DFA,其中OracleS识别出违反PCTL规范的对抗性观测序列。
  • 最终合成的za-DFA是宽松的,允许多个动作对应每个状态,以保持控制自由度,同时确保满足PCTL规范。

实验结果

研究问题

  • RQ1L*-学习能否有效适配以合成满足形式化PCTL规范的POMDPs监督器?
  • RQ2在处理概率系统和有限时域PCTL时,如何使学习过程保持可靠且完备?
  • RQ3为确保在POMDPs中正确且高效地合成监督器,对成员查询和反例处理需要进行哪些修改?
  • RQ4所提出的框架能否在无需预先设定大小约束的情况下,自动确定监督器的状态空间和转移结构?
  • RQ5如何在保证满足PCTL规范的同时,保持所合成监督器的宽松性?

主要发现

  • 所提出的基于L*-学习的监督器合成算法在有限时域PCTL规范下具有可靠性和完备性,保证了终止性和正确性。
  • 该框架成功合成了一个允许每个状态对应多个动作的宽松za-DFA监督器,增强了控制灵活性。
  • 在一个详细示例中,该算法在六轮迭代内收敛至最终的za-DFA,其最大满足概率为0.271,低于0.28的阈值,确认符合规范要求。
  • 该算法通过迭代学习正确识别并细化了反例,包括诸如11、124、121和123等负向反例,每个均导致假设的进一步优化。
  • 将POMCP与PCTL模型检测相结合,实现了满足概率的高效计算,降低了学习循环中的计算开销。
  • 该框架展示了将自动机学习与概率模型检测相结合用于POMDPs中形式化合成的可行性,未来具备实现完整软件集成的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。