Skip to main content
QUICK REVIEW

[论文解读] Safe Reinforcement Learning via Probabilistic Shields

Nils Jansen, Bettina Könighofer|arXiv (Cornell University)|Jul 16, 2018
Software Reliability and Analysis Research参考文献 57被引用 16
一句话总结

本文提出了一种用于马尔可夫决策过程(MDPs)强化学习的概率屏蔽机制,通过阻断超过预设风险阈值δ的动作,以高概率确保安全性。利用安全相关MDP片段的模型检测,屏蔽机制预先评估动作风险并引导探索,从而实现更快的学习速度,训练episode数量减少数个数量级,且安全违规事件显著减少,相较于无屏蔽的强化学习方法。

ABSTRACT

This paper targets the efficient construction of a safety shield for decision making in scenarios that incorporate uncertainty. Markov decision processes (MDPs) are prominent models to capture such planning problems. Reinforcement learning (RL) is a machine learning technique to determine near-optimal policies in MDPs that may be unknown prior to exploring the model. However, during exploration, RL is prone to induce behavior that is undesirable or not allowed in safety- or mission-critical contexts. We introduce the concept of a probabilistic shield that enables decision-making to adhere to safety constraints with high probability. In a separation of concerns, we employ formal verification to efficiently compute the probabilities of critical decisions within a safety-relevant fragment of the MDP. We use these results to realize a shield that is applied to an RL algorithm which then optimizes the actual performance objective. We discuss tradeoffs between sufficient progress in exploration of the environment and ensuring safety. In our experiments, we demonstrate on the arcade game PAC-MAN and on a case study involving service robots that the learning efficiency increases as the learning needs orders of magnitude fewer episodes.

研究动机与目标

  • 解决安全关键系统中强化学习(RL)的不安全探索挑战。
  • 在概率安全约束而非确定性约束下实现高效学习,允许可控风险。
  • 通过在简化后的安全相关MDP上进行形式化模型检测,将安全验证与策略学习解耦。
  • 通过动态调整风险阈值δ,平衡探索效率与安全性。
  • 证明屏蔽后的强化学习在显著更少的训练episode下,实现更优的性能与安全性。

提出的方法

  • 基于基于模型的强化学习,从完整MDP中构建仅包含关键状态与转移的安全相关MDP片段。
  • 使用概率模型检测(通过Storm工具)计算每个动作在有限时域内(例如10步)达到不安全状态的精确概率。
  • 定义δ-屏蔽机制,阻断任何安全概率超过阈值δ的动作,并在每个状态下采用自适应的δ值。
  • 在推理阶段应用屏蔽机制,过滤来自Q-learning智能体的动作,仅允许安全或低风险动作。
  • 通过分段独立的模型检测与多线程处理优化屏蔽构建过程,以应对大规模MDP。
  • 采用回退行为:若在δ下不存在安全动作,则允许最优动作以防止策略崩溃。

实验结果

研究问题

  • RQ1基于模型检测的概率屏蔽能否在确保高概率安全性的前提下,提升强化学习的学习效率?
  • RQ2δ的选择如何影响安全性与探索效率之间的权衡?
  • RQ3屏蔽机制在多大程度上能减少安全关键环境中学习有效策略所需的episode数量?
  • RQ4当使用抽象化与并行化技术时,屏蔽构建过程在大规模MDP上的可扩展性如何?
  • RQ5在PAC-MAN和仓储机器人等真实场景中,屏蔽后的强化学习能否在性能与安全性方面均优于无屏蔽的强化学习?

主要发现

  • 在PAC-MAN环境中,屏蔽后的强化学习实现了显著更高的平均得分(例如,在4只幽灵的27×25网格中,得分分别为339.89 vs. -129.25),并提升了胜率(在小型实例中,胜率从0.04提升至0.84,尽管在大网格中均为0.00)。
  • 在仓储机器人案例研究中,对8个决策状态实施屏蔽后,胜率从0.16提升至0.71,平均得分从-186提升至420。
  • 由于安全违规导致的失败episode显著减少,屏蔽机制使学习有效策略所需的episode数量减少了数个数量级。
  • 对于包含约10^6个状态的MDP,屏蔽构建耗时最多达6小时(单线程),但通过分段与并行构建实现了可扩展性。
  • 即使最优策略可能导致高风险,屏蔽机制仍能有效防止致命动作(如幽灵碰撞),提升了鲁棒性与学习稳定性。
  • 自适应δ机制实现了安全性容忍度的动态调整,使探索成为可能,同时保持了概率安全性保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。