[论文解读] Formal Policy Synthesis for Continuous-Space Systems via Reinforcement Learning
本论文提出了一种强化学习(RL)框架,用于在无需系统模型的情况下,为连续状态的随机系统合成满足线性时序逻辑(LTL)规范的最优策略。通过将LTL转化为LDBA并构建路径依赖的奖励函数,结合使用松弛标签函数的序列学习过程,该方法在温和假设下确保了学习策略的满足概率线性收敛至真实最优值,已在小车-摆臂系统和船舶驾驶问题上得到验证,且置信区间具有高置信度。
This paper studies satisfaction of temporal properties on unknown stochastic processes that have continuous state spaces. We show how reinforcement learning (RL) can be applied for computing policies that are finite-memory and deterministic using only the paths of the stochastic process. We address properties expressed in linear temporal logic (LTL) and use their automaton representation to give a path-dependent reward function maximised via the RL algorithm. We develop the required assumptions and theories for the convergence of the learned policy to the optimal policy in the continuous state space. To improve the performance of the learning on the constructed sparse reward function, we propose a sequential learning procedure based on a sequence of labelling functions obtained from the positive normal form of the LTL specification. We use this procedure to guide the RL algorithm towards a policy that converges to an optimal policy under suitable assumptions on the process. We demonstrate the approach on a 4-dim cart-pole system and 6-dim boat driving problem.
研究动机与目标
- 开发一种数据驱动、无需模型的强化学习方法,用于在未知的连续状态随机系统中合成满足LTL规范的策略。
- 通过基于LTL自动机的正式路径依赖奖励函数,消除对启发式奖励设计的依赖。
- 在系统动态满足适当假设的前提下,确保学习策略收敛至最优满足概率。
- 通过使用松弛LTL规范的序列学习过程,提升样本效率和学习稳定性。
- 将形式化策略合成从有限状态模型扩展至无需离散化或连续性假设的一般连续状态MDP。
提出的方法
- 将LTL规范转化为极限确定性Büchi自动机(LDBA),以表示轨迹的接受条件。
- 基于LDBA状态转移构建路径依赖的奖励函数,使RL能够最大化长期满足时序属性的概率。
- 使用逐步松弛的标签函数(源自LTL公式的正向范式)的序列学习过程,引导探索。
- 应用深度强化学习算法(如A2C),结合对满足概率的下界估计,利用置信参数ζ迭代优化边界。
- 制定一个最优平均奖励准则,在系统满足统一遍历性假设的前提下,确保其线性收敛至真实最优满足概率。
- 利用Hoeffding不等式,基于经验轨迹数据计算真实满足概率的高置信区间。
实验结果
研究问题
- RQ1强化学习能否在不依赖系统模型先验知识的前提下,用于合成连续状态随机系统的最优策略?
- RQ2基于LDBA表示构造的路径依赖奖励函数,是否能实现对LTL规范真实最优满足概率的收敛?
- RQ3使用松弛LTL规范的序列学习过程,能否提升连续状态系统中RL的样本效率与收敛性?
- RQ4在何种假设下,RL框架中的平均奖励准则能线性收敛至真实最优满足概率?
- RQ5如何在无需离散化或连续性假设的前提下,为连续状态MDP中的策略性能建立形式化保证?
主要发现
- 在4D小车-摆臂系统中,基于RL的策略合成方法对满足概率的下界达到0.9526,真实概率位于[0.975, 1]区间内,置信度为1−4×10⁻¹⁰。
- 在6D船舶驾驶问题中,该方法计算出的满足概率下界为0.9810,经经验数据验证,真实概率位于[0.99, 1]区间内,置信度为5×10⁻⁵。
- 在50,000条小车-摆臂轨迹中,仅有1.03%违反了安全约束(位置或角度边界),且大多数在150个时间步内达到目标区间。
- 随着ζ值从0.9950逐步增加至0.9999,序列学习过程导致满足概率的下界单调递增,表明收敛性成立。
- 该方法在温和假设下实现了向最优策略的收敛,船舶问题的计算耗时为70分钟,而基线A2C方法(无序列过程)耗时24小时。
- 理论分析表明,在系统满足统一遍历性假设的前提下,最优平均奖励准则线性收敛至真实最优满足概率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。