[论文解读] Enforcing Hard Constraints with Soft Barriers: Safe Reinforcement Learning in Unknown Stochastic Environments
该论文提出了一种新颖的安全强化学习框架,通过基于生成模型的软屏障函数,在未知随机环境中强制执行硬性安全机会约束。通过将环境动态、软屏障函数和控制策略联合学习的两阶段优化问题进行公式化,该方法直接在轨迹上编码安全概率约束,在模拟实验中实现了显著高于基于CMDP基线方法的系统安全率。
It is quite challenging to ensure the safety of reinforcement learning (RL) agents in an unknown and stochastic environment under hard constraints that require the system state not to reach certain specified unsafe regions. Many popular safe RL methods such as those based on the Constrained Markov Decision Process (CMDP) paradigm formulate safety violations in a cost function and try to constrain the expectation of cumulative cost under a threshold. However, it is often difficult to effectively capture and enforce hard reachability-based safety constraints indirectly with such constraints on safety violation costs. In this work, we leverage the notion of barrier function to explicitly encode the hard safety constraints, and given that the environment is unknown, relax them to our design of \emph{generative-model-based soft barrier functions}. Based on such soft barriers, we propose a safe RL approach that can jointly learn the environment and optimize the control policy, while effectively avoiding unsafe regions with safety probability optimization. Experiments on a set of examples demonstrate that our approach can effectively enforce hard safety constraints and significantly outperform CMDP-based baseline methods in system safe rate measured via simulations.
研究动机与目标
- 为解决在未知随机环境中强制执行基于可达性的硬性安全约束的挑战,其中安全被定义为状态轨迹进入危险区域的概率受到限制。
- 克服基于CMDP的方法的局限性,后者通过累积成本期望间接约束安全,无法保证轨迹层面的安全概率。
- 开发一种可微分的、端到端的框架,联合学习环境的生成模型、用于安全引导的软屏障函数以及最优控制策略。
- 在保持安全策略学习高性能的同时,提供一个实际的安全概率下界,而基于CMDP的方法无法实现这一点。
提出的方法
- 该方法将两阶段优化问题公式化,联合优化策略、软屏障函数以及环境随机动态的生成模型。
- 利用环境-策略闭环系统的轨迹数据训练生成模型,表示为随机微分方程(SDE),以捕捉未知动态和噪声。
- 学习软屏障函数,将系统状态映射为安全概率,初始状态区域的值接近0,危险区域的值接近1,从而确保安全轨迹传播。
- 通过可微分目标函数优化软屏障函数,最小化沿采样合成轨迹的期望屏障值,直接编码安全机会约束。
- 通过最大化从学习到的生成模型生成的合成轨迹上的折扣累积奖励来优化策略,从而实现安全且高回报的策略学习。
- 整个框架完全可微分,并通过基于梯度的优化进行训练,实现动态、安全与控制的联合端到端学习。
实验结果
研究问题
- RQ1在安全被定义为避免任何轨迹点进入危险状态的概率的未知随机环境中,软屏障函数能否有效编码硬性安全机会约束?
- RQ2如何利用环境随机动态的生成模型来训练一种可微分的软屏障函数,以指导安全策略学习?
- RQ3联合优化生成模型、软屏障函数和策略是否能带来显著高于依赖间接成本约束的CMDP方法的系统安全率?
- RQ4所提出的方法能否提供一个实际的安全概率下界,而这是标准CMDP公式无法实现的?
主要发现
- 在所有评估环境(包括2D导航、倒立摆平衡、无人机机动和火箭着陆)中,所提方法的系统安全率显著高于基于CMDP的基线方法。
- 在每种示例500次模拟运行中,该方法在系统安全率上优于PPO-L和FOCOPS,在无人机和火箭着陆任务中观察到最高的安全率。
- 该方法提供了实际的安全概率下界,而基于CMDP的方法仅约束累积成本期望,无法提供此类下界。
- 所学习的软屏障函数将初始状态映射为接近0,危险状态映射为1,且在真实和合成轨迹上保持一致,表明生成模型学习准确。
- 生成模型与真实环境动态高度相似,表现为真实环境与合成环境中屏障函数值和控制轨迹的一致性。
- 尽管安全率更高,但该方法需要大量训练时间——倒立摆任务约8小时,无人机和火箭着陆任务长达1天,凸显了计算上的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。