Skip to main content
QUICK REVIEW

[论文解读] Robust Satisfaction of Temporal Logic Specifications via Reinforcement Learning

Austin Jones, Derya Aksaray|arXiv (Cornell University)|Oct 22, 2015
Formal Methods in Verification参考文献 15被引用 14
一句话总结

该论文提出了一种基于Q-learning的强化学习框架,利用信号时序逻辑(STL)鲁棒性作为连续奖励信号,引导具有未知随机动力学的系统完成复杂的时间任务。通过最大化期望鲁棒性而非仅满足概率,该方法在训练数据有限的情况下实现了更优的收敛性和性能,并且可证明收敛到最优策略,同时实现鲁棒性和概率最大化的双重优化。

ABSTRACT

We consider the problem of steering a system with unknown, stochastic dynamics to satisfy a rich, temporally layered task given as a signal temporal logic formula. We represent the system as a Markov decision process in which the states are built from a partition of the state space and the transition probabilities are unknown. We present provably convergent reinforcement learning algorithms to maximize the probability of satisfying a given formula and to maximize the average expected robustness, i.e., a measure of how strongly the formula is satisfied. We demonstrate via a pair of robot navigation simulation case studies that reinforcement learning with robustness maximization performs better than probability maximization in terms of both probability of satisfaction and expected robustness.

研究动机与目标

  • 为解决控制具有未知随机动力学的系统以满足以信号时序逻辑(STL)指定的复杂时间敏感任务的挑战。
  • 开发一种可证明收敛的强化学习算法,以最大化STL公式满足的期望鲁棒性,这是一种衡量轨迹满足规范程度的连续指标。
  • 证明鲁棒性最大化在满足概率和鲁棒性两方面均优于传统概率最大化方法,尤其在训练样本有限时表现更优。
  • 构建一个有限horizon马尔可夫决策过程(τ-MDP),通过编码τ步状态历史来表示依赖历史的STL规范,从而实现有效学习。

提出的方法

  • 系统建模为τ-MDP,其中状态表示系统状态的最近τ次观测,以捕捉STL规范中的历史依赖性。
  • 采用Q-learning算法通过基于观测奖励的迭代更新Q值来学习策略,奖励函数源自STL鲁棒性程度。
  • 对每个轨迹段计算鲁棒性程度,提供一种连续且可微的度量,用于衡量轨迹满足STL公式的程度。
  • 定义了两种学习目标:最大化STL公式的满足概率和最大化期望鲁棒性,两者均具有可证明的收敛性保证。
  • τ-MDP的构建确保了时间有界STL算子(如U[ a,b ))可通过编码有限历史来处理,避免了基于自动机的转换需求。
  • 通过两个涉及区域时间约束的机器人导航仿真案例研究验证了该方法的有效性。

实验结果

研究问题

  • RQ1当系统动力学未知且具有随机性时,基于鲁棒性最大化的强化学习是否能优于仅基于概率最大化的强化学习来满足STL规范?
  • RQ2与仅最大化满足概率相比,最大化期望鲁棒性如何影响给定STL公式的满足概率?
  • RQ3部分训练(有限训练轮次)对鲁棒性最大化与概率最大化策略的收敛性和性能有何影响?
  • RQ4在何种情况下鲁棒性最大化可涵盖概率最大化?在何种情况下两者在策略质量上出现分歧?
  • RQ5使用具有有限历史的τ-MDP如何有效捕捉时间有界STL算子的语义,从而支持有效学习?

主要发现

  • 在案例研究1中,两种方法均实现了100%的满足概率,但鲁棒性最大化方法的平均鲁棒性显著更高(0.2617 vs. 0.2287)。
  • 在案例研究2中,概率最大化方法未能学习到满足策略(满足概率为0%),而鲁棒性最大化方法实现了100%的满足率,平均鲁棒性为0.1052。
  • 鲁棒性最大化策略收敛更快且更可靠,尤其在满足策略集合较小且难以发现时表现更优。
  • 概率最大化算法因缺乏对近似满足轨迹的部分奖励而近乎随机搜索,而鲁棒性最大化则实现了有方向的探索。
  • τ-MDP的构建成功编码了依赖历史的STL语义,实现了有效学习,且无需基于自动机的转换。
  • 研究表明,当鲁棒性最优策略也以概率1满足公式时,鲁棒性最大化可涵盖概率最大化;否则则不能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。