[论文解读] Certified Reinforcement Learning with Logic Guidance
该论文提出了一种无模型强化学习算法,利用线性时序逻辑(LTL)形式化指定目标,并在连续状态马尔可夫决策过程(MDPs)中以最大概率保证其满足。通过将LTL转化为极限确定性广义Büchi自动机(LDGBA),并实时利用其塑造奖励函数,该方法通过基于核函数的函数逼近和蒙特卡洛采样,结合值迭代算法,实现了可证明正确的策略合成。
Reinforcement Learning (RL) is a widely employed machine learning architecture that has been applied to a variety of control problems. However, applications in safety-critical domains require a systematic and formal approach to specifying requirements as tasks or goals. We propose a model-free RL algorithm that enables the use of Linear Temporal Logic (LTL) to formulate a goal for unknown continuous-state/action Markov Decision Processes (MDPs). The given LTL property is translated into a Limit-Deterministic Generalised Buchi Automaton (LDGBA), which is then used to shape a synchronous reward function on-the-fly. Under certain assumptions, the algorithm is guaranteed to synthesise a control policy whose traces satisfy the LTL specification with maximal probability.
研究动机与目标
- 解决复杂、安全关键强化学习(RL)任务中奖励工程的挑战,其中手工设计的奖励函数脆弱且不透明。
- 通过线性时序逻辑(LTL)实现高层控制目标的形式化指定,可表达复杂的时序与顺序需求。
- 保证合成的策略在未知的连续状态MDP中以最大概率满足给定的LTL规范。
- 开发一种无模型RL框架,将形式化方法(自动机与时序逻辑)与函数逼近及蒙特卡洛采样相结合,以实现可扩展性。
- 提供一种可证明正确的策略合成方法,避免对显式MDP建模或大量奖励调优的需求。
提出的方法
- 将给定的LTL公式转化为极限确定性广义Büchi自动机(LDGBA),以表示期望的时序行为。
- 通过将原始MDP与LDGBA同步,构建一个产品MDP,形成复合状态空间 $(s, q_j)$,其中 $s$ 为系统状态,$q_j$ 为自动机状态。
- 定义一个奖励函数,为LDGBA的接受状态分配 $r_p$,其余状态分配 $r_n$,从而将LTL规范编码为奖励结构。
- 使用带有径向基函数的核平均方法,将值函数 $Lv^{q_j}(s)$ 近似为采样中心的加权平均,实现在连续状态空间中的函数逼近。
- 应用一种改进的值迭代算法(FVI),在自动机状态上执行反向更新,从接受状态开始,将值估计通过产品MDP向前传播。
- 对每个状态-动作对,使用 $Z$ 条轨迹的蒙特卡洛采样来近似贝尔曼更新,用样本平均替代难以计算的积分。
实验结果
研究问题
- RQ1能否在无模型RL中,利用LTL规范自动生成奖励函数,而无需人工奖励工程,适用于连续状态MDP?
- RQ2是否可能在未知的连续状态MDP中,保证学习到的策略以最大概率满足给定的LTL规范?
- RQ3如何将形式化方法(如LDGBA与基于自动机的奖励塑造)与函数逼近及采样技术相结合,以扩展到连续领域?
- RQ4在产品MDP中,对自动机状态进行反向值传播对策略收敛性与正确性有何影响?
- RQ5所提出的方法在安全关键控制任务中,是否能在正确性保证与可扩展性方面优于现有方法(如LCNFQ)?
主要发现
- 所提方法在假设MDP未知但可采样其转移动态的前提下,保证了合成策略以最大概率满足给定的LTL规范。
- LDGBA的使用使得复杂时序属性(如安全性、活锁性与重现性)得以精确编码,这些属性难以通过标量奖励表达。
- 基于核函数的函数逼近(使用径向基函数)可在连续状态空间中实现有效的值函数估计,从而实现对有限状态MDP的可扩展性突破。
- 对 $Z$ 条轨迹的蒙特卡洛采样为在缺乏解析转移概率的情况下,提供了贝尔曼更新的实用且精确的近似。
- 对自动机状态的反向值迭代确保了值估计能从接受状态正确地反向传播至初始状态,从而保持LTL属性的逻辑结构。
- 该方法在正确性保证方面优于先前方法(如LCNFQ),并避免了[18]中MDP抽象技术的可扩展性问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。