Skip to main content
QUICK REVIEW

[论文解读] Constrained Variational Policy Optimization for Safe Reinforcement Learning

Zuxin Liu, Zhepeng Cen|arXiv (Cornell University)|Jan 28, 2022
Reinforcement Learning in Robotics被引用 16
一句话总结

该论文提出了一种新型的安全强化学习算法——约束变分策略优化(CVPO),将安全强化学习建模为使用期望最大化(EM)框架的概率推理问题。通过在闭式解中以凸优化方式计算最优非参数变分分布(E-step),并利用信赖域正则化的监督学习改进策略(M-step),CVPO 实现了稳定、样本高效的训练,并具备可证明的最优性和约束满足保证,其样本效率相比在线策略基线方法最高提升 1000 倍。

ABSTRACT

Safe reinforcement learning (RL) aims to learn policies that satisfy certain constraints before deploying them to safety-critical applications. Previous primal-dual style approaches suffer from instability issues and lack optimality guarantees. This paper overcomes the issues from the perspective of probabilistic inference. We introduce a novel Expectation-Maximization approach to naturally incorporate constraints during the policy learning: 1) a provable optimal non-parametric variational distribution could be computed in closed form after a convex optimization (E-step); 2) the policy parameter is improved within the trust region based on the optimal variational distribution (M-step). The proposed algorithm decomposes the safe RL problem into a convex optimization phase and a supervised learning phase, which yields a more stable training performance. A wide range of experiments on continuous robotic tasks shows that the proposed method achieves significantly better constraint satisfaction performance and better sample efficiency than baselines. The code is available at https://github.com/liuzuxin/cvpo-safe-rl.

研究动机与目标

  • 解决现有原始-对偶方法在安全强化学习中存在不稳定性和缺乏最优性保证的问题。
  • 开发一种安全强化学习方法,确保约束满足的同时保持高样本效率。
  • 利用概率推理将约束强化学习重新表述为凸优化与监督学习问题。
  • 提供关于约束违反边界和策略改进鲁棒性的理论保证。
  • 在连续控制任务中实现离策略学习,以提升样本效率。

提出的方法

  • 将安全强化学习建模为概率推理问题,将约束转化为变分推理目标。
  • 引入期望最大化框架:E-step 通过带闭式解的凸优化计算最优非参数变分分布。
  • M-step 通过在最优变分分布上进行监督学习实现信赖域策略改进,支持离策略更新。
  • 采用对偶变量公式与拉格朗日松弛,以在策略优化过程中强制执行安全约束。
  • 使用基于粒子的采样与 SLSQP 方法,高效求解凸优化的 E-step 问题。
  • 在 M-step 中应用 Polyak 平均与 KL 约束,以稳定训练并确保对分布偏移的鲁棒性。

实验结果

研究问题

  • RQ1能否将安全强化学习重新表述为概率推理问题,以实现更好的稳定性和最优性?
  • RQ2能否通过两步 EM 风格算法(凸 E-step 与监督 M-step)提升约束满足度与样本效率?
  • RQ3在标准假设下,E-step 的闭式解是否能保证最优性与唯一性?
  • RQ4能否在具备鲁棒性保证的前提下,有效将离策略学习集成到约束策略优化中?
  • RQ5在约束违反程度与样本效率方面,该方法相较于在线与离策略基线方法表现如何?

主要发现

  • CVPO 在连续控制任务中相比在线策略基线方法,样本效率最高提升 1000 倍。
  • 与现有原始-对偶方法及策略梯度方法相比,该方法展现出显著更稳定的训练动态。
  • CVPO 实现了更优的约束满足性能,收敛期间的累积成本始终低于基线方法。
  • 由于对偶问题的严格凸性,E-step 的闭式解被证明是最优且唯一的。
  • 信赖域 M-step 提供了最坏情况下的约束违反边界,并增强了对训练不稳定的鲁棒性。
  • 实验结果表明,CVPO 在奖励、约束满足度与训练稳定性方面均优于在线与离策略基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。