Skip to main content
QUICK REVIEW

[论文解读] Safe Planning via Model Predictive Shielding

Osbert Bastani|arXiv (Cornell University)|May 25, 2019
Reinforcement Learning in Robotics参考文献 27被引用 11
一句话总结

本文提出模型预测防护(MPS),一种计算效率高的方法,通过仅在必要时使用备用策略,在实时动态验证强化学习策略的安全性。与离线验证不同,MPS在运行时进行安全检查,确保在已知和新型环境中的安全性,其适应性和效率优于以往的防护方法。

ABSTRACT

Reinforcement learning is a promising approach to synthesizing policies for robotics tasks. A key challenge is ensuring safety of the learned policy---e.g., that a walking robot does not fall over, or an autonomous car does not run into an obstacle. We focus on the setting where the dynamics are known, and the goal is to prove that a policy trained in simulation satisfies a given safety constraint. We build on an approach called shielding, which uses a backup policy to override the learned policy as needed to ensure safety. Our algorithm, called model predictive shielding (MPS), computes whether it is safe to use the learned policy on-the-fly instead of ahead-of-time. By doing so, our approach is computationally efficient, and can furthermore be used to ensure safety even in novel environments. Finally, we empirically demonstrate the benefits of our approach.

研究动机与目标

  • 为解决机器人任务中强化学习策略的安全性挑战,如防止机器人跌倒或车辆碰撞。
  • 开发一种在运行时而非离线预处理阶段验证学习策略安全性的方法。
  • 实现在训练期间未显式训练过的新型或未知环境中的安全运行。
  • 通过将安全检查推迟到运行时,相比现有防护技术提高计算效率。

提出的方法

  • MPS 使用系统动态模型预测未来状态,并验证学习策略的动作是否保持在安全约束范围内。
  • 在每个决策步骤动态计算:是继续遵循学习策略安全,还是必须调用安全备用策略。
  • 防护机制以模型预测控制(MPC)方式运行,在每个时间步使用滚动时域重新评估安全性。
  • 仅当预测到学习策略的轨迹违反安全约束时,才激活备用策略。
  • 通过构造保证安全性,因为当预测到不安全动作时系统始终默认使用安全策略。

实验结果

研究问题

  • RQ1是否可以在不预先计算安全区域的情况下,实现实时确保学习策略的安全性?
  • RQ2与预计算防护相比,运行时安全验证在计算成本和适应性方面有何差异?
  • RQ3该方法是否能在训练期间未见过的新环境中维持安全性?
  • RQ4安全强制执行频率与策略性能之间的权衡是什么?

主要发现

  • MPS 实现了实时安全验证,相比离线防护方法降低了计算开销。
  • 通过在每个时间步动态检查安全性,该方法在已知和新型环境中均保证了安全性。
  • 通过将安全检查推迟到运行时,MPS 提高了适应性,并避免了过度保守的预计算。
  • 实验结果表明,MPS 在各种动态条件下均能保持高策略性能,同时保证安全性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。