[论文解读] Optimal Receding Horizon Control for Finite Deterministic Systems with Temporal Logic Constraints
本文提出了一种针对具有时序逻辑约束的有限确定性系统的可证明正确的一次性滚动时域控制策略,在保证满足线性时序逻辑(LTL)规范的前提下,最小化期望平均惩罚。通过结合基于自动机的综合方法与局部感知及在线规划,该方法在实际应用中实现的平均惩罚低于离线方法,在机器人持续监控案例研究中实现了5.4的最优平均惩罚。
In this paper, we develop a provably correct optimal control strategy for a finite deterministic transition system. By assuming that penalties with known probabilities of occurrence and dynamics can be sensed locally at the states of the system, we derive a receding horizon strategy that minimizes the expected average cumulative penalty incurred between two consecutive satisfactions of a desired property. At the same time, we guarantee the satisfaction of correctness specifications expressed as Linear Temporal Logic formulas. We illustrate the approach with a persistent surveillance robotics application.
研究动机与目标
- 开发一种可证明正确的控制策略,以最小化有限确定性系统中的期望平均累积惩罚。
- 保证以线性时序逻辑(LTL)公式表达的正确性规范得到满足。
- 设计一种在线滚动时域控制策略,利用对惩罚的局部感知,改进离线解决方案。
- 在期望平均惩罚的最优性与动态环境中的实时适应性之间实现平衡。
- 在具有状态相关惩罚与安全约束的持续机器人监控应用中验证该方法。
提出的方法
- 将系统建模为具有状态相关惩罚和已知发生概率的加权确定性转移系统。
- 使用LTL公式编码正确性约束,包括安全性(避免危险状态)和活锁性(重复访问关键位置)。
- 从LTL公式构造Büchi自动机以表示期望行为,并通过产品构造将其与系统结合。
- 应用博弈论技术,计算在满足LTL规范的循环上最小化期望平均惩罚的策略。
- 实现一种在线滚动时域策略,通过在用户定义的规划时域内实时感知惩罚,对离线解进行局部改进。
- 采用基于值迭代的算法计算每轮循环的最优期望平均惩罚,并提供收敛性保证。
实验结果
研究问题
- RQ1能否设计一种滚动时域控制策略,在保证有限确定性系统中满足LTL指定正确性的前提下,最小化期望平均惩罚?
- RQ2与纯离线策略相比,在实际平均惩罚方面,在线局部感知惩罚在性能上如何提升?
- RQ3在具有状态相关风险的持续机器人监控任务中,每轮监控周期的最优期望平均惩罚是多少?
- RQ4在实际中,该在线策略在多大程度上将平均惩罚降低至理论离线最优值以下?
- RQ5在离线与在线控制策略中,监控周期的数量以及收敛行为如何随时间演变?
主要发现
- 在线滚动时域策略在实际中实现的平均累积惩罚显著低于离线策略,且结果始终低于5.4的最优理论值。
- 离线策略的平均惩罚随时间收敛至5.4的最优值,表明其具有渐近最优性。
- 在每一阶段中,第二阶段的监控周期数并未单调增长,表明收敛行为具有非单调性。
- 离线策略在第二阶段的最大监控周期数为7,而在线策略为3,表明在线方法收敛速度更快。
- 在线策略的性能提升源于局部感知与动态规划,使其能够在执行过程中适应实际惩罚的实现。
- 该框架成功保证了LTL指定的性质,包括对基地的重复访问(G F c)、对危险状态的避免(G ¬u),以及包裹运输的交替进行(G (a → X(¬a U b)) ∧ G (b → X(¬b U a)))。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。