Skip to main content
QUICK REVIEW

[论文解读] Towards Safe Reinforcement Learning Using NMPC and Policy Gradients: Part II - Deterministic Case

Sébastien Gros, Mario Zanon|arXiv (Cornell University)|Jun 10, 2019
Advanced Control Systems Optimization参考文献 19被引用 6
一句话总结

本文提出了一种安全强化学习框架,结合确定性策略梯度与鲁棒模型预测控制(MPC),通过硬约束强制执行系统安全性。通过在鲁棒线性MPC中嵌入参数优化以实现安全控制,并利用内点法校正探索过程中的失真,该方法在学习过程中确保安全性,同时通过策略梯度更新实现性能提升。

ABSTRACT

In this paper, we present a methodology to deploy the deterministic policy gradient method, using actor-critic techniques, when the optimal policy is approximated using a parametric optimization problem, where safety is enforced via hard constraints. For continuous input space, imposing safety restrictions on the exploration needed to deploying the deterministic policy gradient method poses some technical difficulties, which we address here. We will investigate in particular policy approximations based on robust Nonlinear Model Predictive Control (NMPC), where safety can be treated explicitly. For the sake of brevity, we will detail the construction of the safe scheme in the robust linear MPC context only. The extension to the nonlinear case is possible but more complex. We will additionally present a technique to maintain the system safety throughout the learning process in the context of robust linear MPC. This paper has a companion paper treating the stochastic policy gradient case.

研究动机与目标

  • 开发一种在学习过程中对系统行为施加硬约束的安全强化学习框架。
  • 解决在确定性策略梯度方法中使用约束策略近似时探索统计失真的技术挑战。
  • 将鲁棒线性模型预测控制(MPC)作为具有可学习参数的安全策略近似机制进行集成。
  • 通过约束优化与参数敏感性分析,在整个学习过程中保持系统安全性。
  • 提供一种计算高效的硬约束下策略梯度估计方法,利用内点技术实现。

提出的方法

  • 将鲁棒线性MPC作为参数优化问题,将安全约束直接嵌入策略近似中。
  • 应用确定性策略梯度方法,通过估计闭环性能关于θ的梯度来更新策略参数θ。
  • 利用参数敏感性分析与内点法,校正由硬约束引起的探索失真,实现高效的梯度计算。
  • 通过约束强化学习步骤(方程84)在学习过程中施加安全性,确保所有策略更新均保持在MPC优化的安全集合内。
  • 采用基于批次的学习方案,通过策略的随机扰动进行探索,并应用校正以保持梯度估计的统计一致性。
  • 将名义MPC模型与偏差参数作为可学习组件,使强化学习算法能够在不损害安全性的前提下,自适应调整模型以匹配实际系统动态。

实验结果

研究问题

  • RQ1当策略受硬性安全限制约束时,如何正确应用确定性策略梯度方法?
  • RQ2当探索受具有硬约束的参数优化限制时,策略梯度估计过程中需要进行哪些校正?
  • RQ3鲁棒线性MPC能否作为支持端到端学习的可靠策略近似框架,配合策略梯度方法使用?
  • RQ4如何在整个强化学习过程中,即使在探索阶段,也保持系统安全性?
  • RQ5哪些计算技术能够实现安全强化学习中约束策略优化的高效梯度计算?

主要发现

  • 所提方法在100次强化学习步骤中成功提升了闭环性能,仿真结果表明性能代价J单调下降。
  • 系统轨迹被引导更接近参考状态,同时保持在安全约束‖x‖² ≤ 1 内,如图5所示。
  • 强化学习算法并未简单识别真实系统动态,因为名义MPC模型未收敛至真实系统,表明其为性能驱动的自适应而非系统辨识。
  • 模型偏差的分散集合随时间向内调整,特别是在靠近状态约束的关键区域,提升了性能且未违反安全性。
  • MPC中的反馈增益K仅发生微小调整,表明性能提升主要通过名义模型与偏差参数的自适应实现。
  • 约束强化学习步骤(84)成功防止了不安全的策略更新,确保所有学习到的策略均保持在MPC约束定义的安全集合内。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。