Skip to main content
QUICK REVIEW

[论文解读] Safe Reinforcement Learning via Online Shielding.

Osbert Bastani|arXiv (Cornell University)|May 25, 2019
Reinforcement Learning in Robotics参考文献 10被引用 9
一句话总结

本文提出了一种在线屏蔽机制,用于安全强化学习,其中备份控制器会实时动态地覆盖学习到的策略,以强制执行安全约束。通过在线而非离线计算安全决策,该方法确保了可扩展性,并能适应新环境,在带有随机障碍物的模拟小车-摆杆和自行车导航任务中成功实现了安全控制。

ABSTRACT

Reinforcement learning is a promising approach to learning control policies for complex robotics tasks. A key challenge is ensuring safety of the learned control policy---e.g., that a walking robot does not fall over, or a quadcopter does not run into a wall. We focus on the setting where the dynamics are known, and the goal is to prove that a policy learned in simulation satisfies a given safety constraint. Existing approaches for ensuring safety suffer from a number of limitations---e.g., they do not scale to high-dimensional state spaces, or they only ensure safety for a fixed environment. We propose an approach based on shielding, which uses a backup controller to override the learned controller as necessary to ensure that safety holds. Rather than compute when to use the backup controller ahead-of-time, we perform this computation online. By doing so, we ensure that our approach is computationally efficient, and furthermore, can be used to ensure safety even in novel environments. We empirically demonstrate that our approach can ensure safety in experiments on cart-pole and on a bicycle with random obstacles.

研究动机与目标

  • 为解决在复杂机器人任务中确保强化学习策略安全性的挑战,特别是当策略在仿真环境中训练时。
  • 克服先前安全方法在高维状态空间中缺乏可扩展性或在新环境中失效的局限性。
  • 开发一种计算高效的在线安全机制,而非依赖于预先计算的安全条件。
  • 确保即使在环境发生变化或在训练时未完全已知的情况下,安全保证依然成立。

提出的方法

  • 该方法采用屏蔽框架,实时监控学习策略的动作,并在安全约束可能被违反时,通过备份控制器进行干预。
  • 安全决策在线计算,从而能够动态适应变化或未知的环境条件。
  • 备份控制器基于已知的系统动力学和安全约束设计,确保所采取的任何动作均保持安全。
  • 该方法利用已知动力学实时计算安全动作,避免了对安全区域进行离线预计算的需求。
  • 屏蔽机制与强化学习策略集成,使智能体能够在保持安全边界的前提下进行探索和学习。
  • 该方法应用于连续控制任务,如小车-摆杆和模拟自行车在随机障碍物中导航。

实验结果

研究问题

  • RQ1在线屏蔽能否在先前方法无法扩展的高维状态空间中确保安全性?
  • RQ2与离线方法相比,在线计算安全覆盖是否能提高对新环境或未见环境的适应性?
  • RQ3屏蔽机制能否在保证安全的前提下,维持复杂控制任务中的性能和学习效率?
  • RQ4在线屏蔽在具有动态障碍物的模拟环境中强制执行安全约束的有效性如何?

主要发现

  • 所提出的在线屏蔽方法在带有随机障碍物的小车-摆杆和自行车导航任务中均成功强制执行了安全约束。
  • 由于其在线计算安全决策,该方法可扩展至高维状态空间,避免了离线分析带来的计算负担。
  • 即使在训练期间未见过的新环境中,安全依然得以维持,表明其对环境变化具有鲁棒性。
  • 该方法实现了安全的探索与学习,且未损害底层强化学习策略的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。