Skip to main content
QUICK REVIEW

[论文解读] Safe and Efficient Reinforcement Learning Using Disturbance-Observer-Based Control Barrier Functions

Yikun Cheng, Zhao Pan|arXiv (Cornell University)|Nov 30, 2022
Reinforcement Learning in Robotics被引用 5
一句话总结

该论文提出了一种无需模型的、基于扰动观测器的控制障碍函数(DOB-CBF)的安全强化学习框架,以在不需学习不确定性模型的情况下确保安全。通过实时估计扰动并利用二次规划强制执行鲁棒CBF条件,该方法在无模型的强化学习中显著降低了安全违规率,并在样本效率和计算效率方面优于基于高斯过程(GP)的CBF方法,该方法在单轨车和二维四旋翼飞行器上得到了验证。

ABSTRACT

Safe reinforcement learning (RL) with assured satisfaction of hard state constraints during training has recently received a lot of attention. Safety filters, e.g., based on control barrier functions (CBFs), provide a promising way for safe RL via modifying the unsafe actions of an RL agent on the fly. Existing safety filter-based approaches typically involve learning of uncertain dynamics and quantifying the learned model error, which leads to conservative filters before a large amount of data is collected to learn a good model, thereby preventing efficient exploration. This paper presents a method for safe and efficient RL using disturbance observers (DOBs) and control barrier functions (CBFs). Unlike most existing safe RL methods that deal with hard state constraints, our method does not involve model learning, and leverages DOBs to accurately estimate the pointwise value of the uncertainty, which is then incorporated into a robust CBF condition to generate safe actions. The DOB-based CBF can be used as a safety filter with model-free RL algorithms by minimally modifying the actions of an RL agent whenever necessary to ensure safety throughout the learning process. Simulation results on a unicycle and a 2D quadrotor demonstrate that the proposed method outperforms a state-of-the-art safe RL algorithm using CBFs and Gaussian processes-based model learning, in terms of safety violation rate, and sample and computational efficiency.

研究动机与目标

  • 解决现有依赖模型学习和高斯过程回归进行不确定性量化的方法在安全强化学习中的低效性和过度保守问题。
  • 通过消除对动态模型学习的需求,在无模型强化学习中实现安全探索,同时保持硬性安全约束。
  • 通过用扰动观测器替代计算量大的高斯过程模型,提升样本效率和计算效率。
  • 通过精确的实时扰动估计和预计算的估计误差界,确保鲁棒安全性。
  • 与最先进的基于GP的不确定性建模的CBF安全强化学习方法相比,展示出更优的安全性和效率。

提出的方法

  • 利用扰动观测器(DOB)实时估计累积不确定性(未建模动力学)的点值。
  • 使用可预先计算的估计误差界(EEB)量化DOB对扰动估计的准确性。
  • 将估计的扰动和EEB整合到鲁棒控制障碍函数(CBF)条件中,以确保安全性。
  • 应用二次规划(QP)计算满足鲁棒CBF条件的最小动作修正,从而在最小化策略偏离的前提下确保安全性。
  • 作为安全过滤器运行,可无缝集成到任何无模型强化学习算法中,而无需修改策略训练过程。
  • 仅依赖已知的名义模型,无需学习真实系统动力学或不确定性分布。

实验结果

研究问题

  • RQ1基于扰动观测器的CBF框架是否能在无需动态模型学习的情况下实现在无模型强化学习中的安全探索?
  • RQ2与基于GP的CBF方法相比,DOB-CBF方法在训练过程中的安全违规率如何?
  • RQ3在高维机器人控制任务中,DOB-CBF-RL与GP-CBF-RL相比,在计算效率和样本效率方面表现如何?
  • RQ4DOB在不同训练阶段提供的扰动估计在稳定性和准确性方面如何?
  • RQ5DOB-CBF框架在保持安全的前提下,能在多大程度上实现更激进和高效的策略学习?

主要发现

  • 在二维四旋翼飞行器上,DOB-CBF-RL在最后1500–2000个训练回合中实现了0.0%的安全违规率,而GP-CBF-RL的违规率为40.4%。
  • 在初始训练阶段(第1–500回合),DOB-CBF-RL的安全违规率为15.8%,而GP-CBF-RL高达91.4%,表明其早期安全性显著提升。
  • 经过预训练后,GP-CBF-RL在前500回合的违规率降至30.8%,但仍低于DOB-CBF-RL的15.8%。
  • DOB从一开始就提供了稳定的扰动估计,误差始终低于5%;而GP模型需超过600,000步才能将误差降至5%以下。
  • DOB-CBF-RL每1,000步的平均计算时间至少比GP-CBF-RL快三倍,凸显其卓越的计算效率。
  • DOB-CBF-RL智能体在6000个回合内学习到了高性能策略,而GP-CBF-RL智能体在相同回合数内未能收敛到可比策略,表明其具有更好的样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。