[论文解读] Q-Learning for Robust Satisfaction of Signal Temporal Logic Specifications
本文提出一种基于Q-learning的方法,用于在系统动态未知的情况下,合成满足随机系统信号时态逻辑(STL)规范的控制策略。通过将系统建模为τ-MDP,并将STL满足概率与鲁棒度作为累积奖励进行近似,该方法使Q-learning能够同时优化规范满足的可能性与质量。仿真结果表明,与仅最大化概率相比,通过最大化期望鲁棒度可实现更优性能。
This paper addresses the problem of learning optimal policies for satisfying signal temporal logic (STL) specifications by agents with unknown stochastic dynamics. The system is modeled as a Markov decision process, in which the states represent partitions of a continuous space and the transition probabilities are unknown. We formulate two synthesis problems where the desired STL specification is enforced by maximizing the probability of satisfaction, and the expected robustness degree, that is, a measure quantifying the quality of satisfaction. We discuss that Q-learning is not directly applicable to these problems because, based on the quantitative semantics of STL, the probability of satisfaction and expected robustness degree are not in the standard objective form of Q-learning. To resolve this issue, we propose an approximation of STL synthesis problems that can be solved via Q-learning, and we derive some performance bounds for the policies obtained by the approximate approach. The performance of the proposed method is demonstrated via simulations.
研究动机与目标
- 解决在系统动态未知的情况下,控制复杂、时间敏感任务(以信号时态逻辑STL表示)的挑战。
- 提出两个控制综合问题:最大化STL满足的概率,以及最大化期望鲁棒度(作为满足质量的度量)。
- 通过提出一种新颖的近似框架,克服STL的定量语义与标准Q-learning目标之间的不兼容性。
- 为近似策略解提供性能边界,确保在适当参数选择下,其性能可接近最优。
- 通过涉及空间与时间任务规范的仿真案例研究,验证该方法的有效性。
提出的方法
- 将系统建模为马尔可夫决策过程(MDP),其中状态表示系统轨迹的τ长度历史,形成τ-MDP以捕捉STL规范中的历史依赖性。
- 定义STL的一个片段,包含时间有界算子(F[a,b], G[a,b]),以支持有限状态抽象与τ-MDP的构建。
- 通过利用时态逻辑语义与状态历史追踪,将满足概率与期望鲁棒度近似为累积奖励。
- 对近似目标函数应用Q-learning,其中智能体通过在多个训练周期内最大化近似奖励之和来学习策略。
- 采用学习率衰减调度(αk = 0.95k),并通过调整超参数(β, γ)以平衡探索与收敛。
- 推导理论性能边界,表明通过选择适当的τ与近似参数,近似策略的性能可被任意逼近真实最优策略。
实验结果
研究问题
- RQ1当系统动态未知且目标函数(满足概率与鲁棒度)不满足标准Q-learning形式时,Q-learning能否有效应用于STL规范合成?
- RQ2如何以与强化学习兼容的方式建模依赖历史的STL规范(如要求事件时间顺序的规范)?
- RQ3何种近似策略可实现将STL满足概率与鲁棒度转换为适合Q-learning的累积奖励结构?
- RQ4通过近似方法学习的策略在满足概率与鲁棒度方面,与真实最优策略的接近程度如何?
- RQ5在基于Q-learning的STL合成中,最大化期望鲁棒度是否比最大化满足概率带来更好的收敛性与性能?
主要发现
- 经过2000次训练周期后,最大化期望鲁棒度的策略(π∗₂ₐ)在规范Φ₂上的满足概率达到93.6%,显著优于仅最大化概率的策略(π∗₁ₐ)所达到的73.2%满足概率。
- π∗₂ₐ下的期望鲁棒度为0.422,而π∗₁ₐ下仅为0.084,表明其满足质量显著更高。
- 基于鲁棒度的策略表现出更快的收敛速度与更明确的搜索行为,因其能为接近满足规范的轨迹获得部分奖励。
- 相比之下,仅最大化概率的策略依赖随机搜索,直到遇到完全满足的轨迹才开始收敛,因此在满足策略稀少时收敛更慢。
- 理论性能边界证实,通过选择适当的τ与近似参数,近似策略的性能可被任意逼近真实最优策略。
- 仿真结果验证了该方法在涉及重复区域访问与时间约束的复杂STL任务中的有效性,平均在6分钟内实现稳定收敛。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。