[论文解读] Learning Barrier Certificates: Towards Safe Reinforcement Learning with Zero Training-time Violations
该论文提出CRABS,一种协同训练的强化学习算法,通过迭代学习屏障证书、动态模型和策略,实现训练期间零安全违规。通过对抗性训练学习安全认证的屏障函数,并与策略和动态模型学习协同优化,CRABS在低维连续控制任务中实现零安全违规,而先前方法则需数百次不安全交互。
Training-time safety violations have been a major concern when we deploy reinforcement learning algorithms in the real world. This paper explores the possibility of safe RL algorithms with zero training-time safety violations in the challenging setting where we are only given a safe but trivial-reward initial policy without any prior knowledge of the dynamics model and additional offline data. We propose an algorithm, Co-trained Barrier Certificate for Safe RL (CRABS), which iteratively learns barrier certificates, dynamics models, and policies. The barrier certificates, learned via adversarial training, ensure the policy's safety assuming calibrated learned dynamics model. We also add a regularization term to encourage larger certified regions to enable better exploration. Empirical simulations show that zero safety violations are already challenging for a suite of simple environments with only 2-4 dimensional state space, especially if high-reward policies have to visit regions near the safety boundary. Prior methods require hundreds of violations to achieve decent rewards on these tasks, whereas our proposed algorithms incur zero violations.
研究动机与目标
- 开发一种安全强化学习算法,在安全关键应用中实现训练期间零安全违规。
- 在仅具备安全但低回报初始策略、且无动力学或离线数据先验知识的挑战性设置下运行。
- 通过迭代循环协同训练屏障证书、策略和动态模型,以扩展认证安全区域并提升样本效率。
- 避免依赖不安全轨迹进行安全约束学习,与先前约束策略优化方法不同。
- 通过端到端学习屏障函数,将基于模型的安全强化学习从手工设计的屏障函数扩展至更广泛场景。
提出的方法
- CRABS通过交替迭代过程协同训练屏障证书、策略和动态模型。
- 屏障证书通过对抗性训练学习,以认证状态空间的安全区域,确保策略始终处于安全集合内。
- 该算法使用正则化项以鼓励更大的认证区域,从而在安全约束下实现更优探索。
- 仅使用来自认证安全区域的数据来优化动态模型,提升其准确性和校准性。
- 该方法针对当前及历史策略的轨迹量身定制屏障证书,将表达能力集中于相关且高回报区域。
- 通过仅允许在学习到的屏障函数的上水平集内与环境交互来实现安全,该集合定义了认证安全区域。
实验结果
研究问题
- RQ1我们能否在无动力学或离线数据先验知识的情况下,在安全强化学习中实现训练期间零安全违规?
- RQ2屏障证书的对抗性训练能否在无需离散化的情况下实现在高维状态空间中的安全探索?
- RQ3与顺序或独立训练相比,协同训练屏障证书、策略和动态模型在安全性和样本效率方面有何改进?
- RQ4学习到的屏障证书在安全性与奖励方面,与手工设计或事后添加的安全约束相比,能多大程度上表现更优?
- RQ5通过协同学习,认证安全区域能否被迭代扩展,以在安全边界附近实现高回报策略?
主要发现
- CRABS在一系列2至4维连续控制任务中实现训练期间零安全违规,包括需要在安全边界附近探索的任务。
- 在Swing环境中,目标是在90°安全约束下最大化杆的角度,CRABS将安全违规次数从数百次减少至零。
- 在2D倒立摆环境中,先前方法至少需要80次不安全轨迹,而CRABS实现零违规。
- 鼓励更大认证区域的正则化项提升了探索能力,并促成高回报策略的收敛。
- 与策略和动态模型协同训练屏障证书,相比独立训练,可获得更准确和校准性更好的动态模型。
- 该方法优于依赖对比安全与不安全轨迹的现有安全强化学习方法,后者本质上需要一定数量的不安全交互。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。