Skip to main content
QUICK REVIEW

[论文解读] CUP: A Conservative Update Policy Algorithm for Safe Reinforcement Learning

Long Yang, Jiaming Ji|arXiv (Cornell University)|Feb 15, 2022
Reinforcement Learning in Robotics被引用 7
一句话总结

CUP 是一种用于安全强化学习的保守更新策略算法,通过利用更紧致的性能边界和广义优势估计算法(GAE)作为代理函数,提供理论上的安全保证。该算法支持非凸的一阶梯度优化,无需凸近似,可在连续控制任务中实现更高的回报,同时保持更高的安全性,优于当前最先进方法。

ABSTRACT

Safe reinforcement learning (RL) is still very challenging since it requires the agent to consider both return maximization and safe exploration. In this paper, we propose CUP, a Conservative Update Policy algorithm with a theoretical safety guarantee. We derive the CUP based on the new proposed performance bounds and surrogate functions. Although using bounds as surrogate functions to design safe RL algorithms have appeared in some existing works, we develop them at least three aspects: (i) We provide a rigorous theoretical analysis to extend the surrogate functions to generalized advantage estimator (GAE). GAE significantly reduces variance empirically while maintaining a tolerable level of bias, which is an efficient step for us to design CUP; (ii) The proposed bounds are tighter than existing works, i.e., using the proposed bounds as surrogate functions are better local approximations to the objective and safety constraints. (iii) The proposed CUP provides a non-convex implementation via first-order optimizers, which does not depend on any convex approximation. Finally, extensive experiments show the effectiveness of CUP where the agent satisfies safe constraints. We have opened the source code of CUP at https://github.com/RL-boxes/Safe-RL.

研究动机与目标

  • 为解决强化学习中安全探索的挑战,确保回报最大化和约束满足。
  • 消除对非凸目标和约束的凸近似的依赖,此类近似会引入误差并增加计算开销。
  • 开发一种理论基础扎实、基于样本的安全强化学习实现,高效且可扩展至高维问题。
  • 提供比以往工作更紧致的性能边界,从而实现对真实目标和安全约束更优的局部近似。
  • 设计一种实用算法,通过策略投影维持安全性,同时确保回报的单调提升。

提出的方法

  • 利用广义优势估计算法(GAE)推导出策略之间的新型广义差值边界,降低方差的同时保持偏差控制。
  • 提出比以往工作更紧致的性能边界,提升目标和约束的局部近似质量。
  • 提出两步CUP更新机制:首先通过梯度上升进行策略改进,然后将策略投影到安全策略区域以强制执行约束。
  • 基于推导出的边界使用代理函数,替代优化中的原始目标和约束。
  • 通过一阶梯度方法实现非凸优化,避免昂贵的Fisher信息矩阵求逆计算。
  • 采用带自适应ν的拉格朗日乘子法,平衡回报与安全性,同时提供改进和约束违反的理论边界。

实验结果

研究问题

  • RQ1通过GAE推导出的更紧致性能边界,是否能提升约束强化学习中策略更新的安全性和稳定性?
  • RQ2基于这些边界的代理函数,如何在不使用凸近似的情况下实现安全策略优化?
  • RQ3所提出的CUP算法在保持安全性的同时最大化回报方面,相较于现有安全强化学习基线方法,性能提升程度如何?
  • RQ4在所提出的保守更新框架中,策略改进和约束违反的理论保证是什么?
  • RQ5CUP算法能否通过一阶梯度优化在高维连续控制环境中实现高效实现?

主要发现

  • CUP通过推导出的更紧致边界实现理论上的安全保证,其边界比以往工作更紧,从而实现对真实目标和约束更优的局部近似。
  • 该算法在如MuJoCo机器人等具有速度限制和圆形约束的安全关键环境中表现出更优性能,始终满足安全约束。
  • 在多个基准测试中,CUP在回报最大化和约束遵守方面均优于当前最先进方法,包括CPO、PCPO、FOCOPS和PPO-L。
  • 在理论边界中使用GAE可降低策略更新的方差,有助于实现更稳定高效的训练,同时不牺牲偏差控制。
  • 通过一阶梯度优化器实现的非凸实现避免了高维Fisher矩阵求逆,显著降低了计算成本。
  • 实验结果表明,CUP在复杂环境(如Circle任务)中仍能保持安全行为,即在最大化奖励的同时避免进入禁止区域。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。