[论文解读] Robust Model Predictive Shielding for Safe Reinforcement Learning with Stochastic Dynamics
该论文提出鲁棒模型预测屏蔽(RMPS),一种通过使用基于管道的鲁棒非线性模型预测控制器(NMPC)作为备份,确保随机非线性系统强化学习安全性的框架。它利用采样轨迹和统计学习理论,对可达集提供高概率保证,从而在小车间和非完整系统等含随机障碍物的环境中实现安全且高性能的控制。
This paper proposes a framework for safe reinforcement learning that can handle stochastic nonlinear dynamical systems. We focus on the setting where the nominal dynamics are known, and are subject to additive stochastic disturbances with known distribution. Our goal is to ensure the safety of a control policy trained using reinforcement learning, e.g., in a simulated environment. We build on the idea of model predictive shielding (MPS), where a backup controller is used to override the learned policy as needed to ensure safety. The key challenge is how to compute a backup policy in the context of stochastic dynamics. We propose to use a tube-based robust NMPC controller as the backup controller. We estimate the tubes using sampled trajectories, leveraging ideas from statistical learning theory to obtain high-probability guarantees. We empirically demonstrate that our approach can ensure safety in stochastic systems, including cart-pole and a non-holonomic particle with random obstacles.
研究动机与目标
- 解决在动力学已知但受加性随机扰动影响的随机非线性动力系统中,确保强化学习策略安全性的挑战。
- 克服现有屏蔽方法的局限性,这些方法要么假设确定性动力学,要么仅适用于线性系统,从而限制了其在复杂机器人任务中的适用性。
- 开发一种可扩展且理论基础坚实的高维、非线性、随机控制环境下的安全验证方法。
- 通过在必要时动态覆盖黑箱深度强化学习策略,实现其安全部署,使用经证明安全的备份控制器。
- 利用统计学习理论,为备份控制器的可达集大小提供有限样本的概率保证。
提出的方法
- 使用基于管道的鲁棒NMPC作为备份控制器,以处理随机扰动,并确保非线性系统中的安全性。
- 通过从随机动力学中采样轨迹,估计备份控制器的前向可达集。
- 应用统计学习理论(如VC维界)推导出围绕标称轨迹的估计管道大小的高概率置信区间。
- 将估计的管道与模型预测屏蔽(MPS)框架集成,以动态检查所学策略是否可安全执行。
- 在每个时间步判断当前状态是否位于估计的安全管道内;若否,则激活备份NMPC控制器。
- 使用概率鲁棒可恢复性条件,确保即使策略发生偏离,系统也能以高概率被重新引导回安全区域。
实验结果
研究问题
- RQ1能否将屏蔽框架扩展至随机非线性系统,同时保持理论上的安全保证?
- RQ2在存在随机扰动的情况下,如何为鲁棒NMPC控制器的可达集建立有限样本的概率保证?
- RQ3与线性近似相比,动力学中考虑非线性特性在安全强化学习中在多大程度上降低了保守性?
- RQ4基于采样的管道估计方法是否能在高维系统中同时实现计算可行性与强理论保证?
- RQ5在随机环境中,使用鲁棒NMPC备份与线性MPC备份相比,所学策略的性能表现如何?
主要发现
- RMPS在随机非线性系统(如小车-摆杆和带随机障碍物的非完整粒子系统)中实现了安全控制,提供了高概率的安全保证。
- 与线性鲁棒MPC(LRMPS)相比,该方法降低了保守性,实验中备份控制器激活次数更少,表明策略性能更优。
- 在小车-摆杆环境中,RMPS在比LRMPS更多的初始$(\theta, \omega)$状态下成功稳定了摆杆,证明了其更强的鲁棒性和性能。
- 理论分析表明,系统以高概率保持$1 - (T+1)\epsilon$的鲁棒可恢复性,其中$\epsilon$由统计学习界推导得出。
- 基于采样的管道估计方法为可达集提供了有限样本的概率保证,使实际部署具备理论支持。
- 实证结果证实,RMPS在确保安全的同时保持了高性能,其在覆盖范围和备份使用频率方面均优于LRMPS。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。