[论文解读] Tractable Reinforcement Learning of Signal Temporal Logic Objectives
该论文通过引入一种基于标志的马尔可夫决策过程(F-MDP),提出了一种可处理的信号时序逻辑(STL)目标强化学习方法,该方法利用标志紧凑地编码状态历史,以追踪子公式的满足情况。该方法实现了状态空间多项式增长的高效Q-learning,显著降低了与传统τ-MDP相比的计算复杂度,同时在STL规范下实现了接近最优的满足概率。
Signal temporal logic (STL) is an expressive language to specify time-bound real-world robotic tasks and safety specifications. Recently, there has been an interest in learning optimal policies to satisfy STL specifications via reinforcement learning (RL). Learning to satisfy STL specifications often needs a sufficient length of state history to compute reward and the next action. The need for history results in exponential state-space growth for the learning problem. Thus the learning problem becomes computationally intractable for most real-world applications. In this paper, we propose a compact means to capture state history in a new augmented state-space representation. An approximation to the objective (maximizing probability of satisfaction) is proposed and solved for in the new augmented state-space. We show the performance bound of the approximate solution and compare it with the solution of an existing technique via simulations.
研究动机与目标
- 解决由于τ-MDP中状态空间指数级增长导致的STL满足策略学习的计算不可行性。
- 克服τ-MDP的局限性,即需要在有限时间窗口τ内存储完整的状态历史,从而导致状态空间爆炸(m^τ)。
- 设计一种紧凑且可扩展的表示方法,以捕捉STL满足所必需的历史信息,而无需存储完整的状态序列。
- 在新扩展的状态空间上实现高效的无模型强化学习(通过Q-learning),以最大化STL规范满足的概率。
- 提供理论性能边界并进行实证验证,表明在长时域STL规范下具有更高的可扩展性和更快的学习速度。
提出的方法
- 提出F-MDP,一种新的MDP公式,通过在原始系统状态中增加标志状态,以追踪STL子公式的部分满足情况。
- 为STL规范中的每个子公式定义标志状态,其中每个标志用于追踪该子公式在其时间时域内是否已被满足。
- 采用递归标志更新机制,以紧凑方式维护历史信息,避免存储完整的状态历史。
- 将学习目标表述为在F-MDP中最大化STL满足的概率,以有界误差近似真实目标。
- 在F-MDP上应用Q-learning,使用基于STL鲁棒性与标志转移的奖励函数,实现样本高效的策略学习。
- 证明F-MDP的状态空间复杂度为O(|Σ| × (h+1)^k),相对于时域τ呈多项式增长,其中h为子公式的最大时域,k为子公式数量。
实验结果
研究问题
- RQ1能否设计一种紧凑的状态表示,以避免在STL目标强化学习中出现状态空间的指数级增长?
- RQ2与τ-MDP基线相比,基于F-MDP的策略在满足概率和学习效率方面表现如何?
- RQ3所提出的近似方法相对于真实STL满足概率目标的理论性能边界是什么?
- RQ4F-MDP公式能否扩展到长时域STL时域和复杂规范,这些规范对τ-MDP而言是不可行的?
- RQ5基于标志的表示是否能在STL任务的Q-learning中实现更快的收敛速度和更低的内存占用?
主要发现
- F-MDP将状态空间复杂度从τ-MDP中的指数级(m^τ)降低为关于时域τ和子公式数量k的多项式复杂度(|Σ| × (h+1)^k)。
- 当τ = 3时,F-MDP训练耗时6分钟,内存使用2.9×10³单位,而τ-MDP耗时21分钟,内存使用1.7×10⁴单位,显示出3.5倍的速度提升和6倍的内存减少。
- 当τ = 5时,F-MDP使用18分钟和18×10³内存,而τ-MDP需290分钟和1×10⁶内存,表明速度提升达16倍,内存减少55倍。
- 在h=5(τ=6)的巡逻任务中,τ-MDP因内存溢出(数组大小超限)而失败,而F-MDP成功完成,耗时24分钟,内存使用24×10³单位。
- 通过F-MDP学习到的策略在h=5时达到Pr[s₀:17 |= Φ₂] = 0.8432,表明在长时域规范下具有很高的满足概率。
- 在可达性任务中,F-MDP策略实现了99.6%的满足率(500条轨迹中498条满足),证实了其高可靠性和接近最优性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。