Skip to main content
QUICK REVIEW

[论文解读] Do Androids Dream of Electric Fences? Safety-Aware Reinforcement Learning with Latent Shielding

Chloe He, Borja G. León|arXiv (Cornell University)|Dec 21, 2021
Adversarial Robustness in Machine Learning被引用 5
一句话总结

本文提出潜在屏蔽(latent shielding),一种面向安全的强化学习框架,利用数据驱动的潜在世界模型,在无需手工构建动力学模型的情况下,实现在高维复杂环境中的屏蔽。通过在学习到的模型中预演未来轨迹,该屏蔽机制可防止不安全动作,显著减少训练过程中的安全违规,同时保持在基准环境中的强大性能。

ABSTRACT

The growing trend of fledgling reinforcement learning systems making their way into real-world applications has been accompanied by growing concerns for their safety and robustness. In recent years, a variety of approaches have been put forward to address the challenges of safety-aware reinforcement learning; however, these methods often either require a handcrafted model of the environment to be provided beforehand, or that the environment is relatively simple and low-dimensional. We present a novel approach to safety-aware deep reinforcement learning in high-dimensional environments called latent shielding. Latent shielding leverages internal representations of the environment learnt by model-based agents to "imagine" future trajectories and avoid those deemed unsafe. We experimentally demonstrate that this approach leads to improved adherence to formally-defined safety specifications.

研究动机与目标

  • 为解决在真实环境中部署深度强化学习智能体时,安全违规可能导致不可逆损害的挑战。
  • 克服现有屏蔽方法依赖手工构建环境动力学模型的局限性,此类模型构建耗时且易出错。
  • 实现在高维、随机性及连续环境中安全的探索与训练,这些环境难以构建符号化模型。
  • 开发一种利用基于模型智能体内部表征来预测并避免不安全轨迹的屏蔽机制。
  • 证明尽管失去了形式化可验证性,学习到的抽象仍能提供与形式化符号屏蔽相当的有效安全保障。

提出的方法

  • 该方法采用循环状态空间模型(SRSSM)从智能体经验中学习潜在世界模型,无需显式环境建模即可捕捉随机动力学。
  • 屏蔽机制利用潜在世界模型对未来轨迹进行仿真,识别并阻断导致不安全状态的动作(由正式的scLTL规范定义)。
  • 在潜在世界模型中训练一种安全感知策略,以减少训练过程中暴露于不安全状态,提升样本效率与安全性。
  • 该框架引入一种新颖的屏蔽引入时间调度机制,防止过早屏蔽,避免其对基于模型的强化学习性能造成损害。
  • 系统结合模仿学习与基于课程的探索策略,以提升潜在空间中的学习效率。
  • 屏蔽通过基于轨迹预测覆盖不安全动作实现,采用基于进展的监控机制来检查scLTL规范。

实验结果

研究问题

  • RQ1能否有效利用数据驱动的潜在世界模型构建屏蔽机制,以防止在高维随机环境中出现不安全动作?
  • RQ2在安全性和最终性能方面,潜在屏蔽与无屏蔽智能体及符号屏蔽方法相比表现如何?
  • RQ3在不适当的时间引入屏蔽是否会降低基于模型智能体的学习性能?若会,如何缓解此问题?
  • RQ4所学世界模型的保真度在多大程度上影响屏蔽智能体的安全性与鲁棒性?
  • RQ5学习到的抽象能否提供足够强的安全保障,使其在真实世界强化学习部署中具有实际应用价值?

主要发现

  • 与无屏蔽智能体相比,潜在屏蔽在训练过程中显著减少了安全违规次数,更严格遵守了正式的安全规范。
  • 尽管缺乏形式化可验证性,该方法在测试性能上与符号屏蔽方法相当。
  • 引入屏蔽引入时间调度有效防止了因过早屏蔽导致的性能下降,尤其在基于模型的强化学习智能体中效果显著。
  • 该框架在连续控制与离散控制环境中均成功运行,展现出广泛的适用性。
  • 使用学习到的世界模型使得在难以手工构建动力学模型的环境中也能实现安全训练。
  • 实证结果表明,该屏蔽机制可通过重构预演轨迹中导致违规状态的路径,有效阻止不安全动作。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。