Skip to main content
QUICK REVIEW

[论文解读] Context-Aware Safe Reinforcement Learning for Non-Stationary Environments

Baiming Chen, Zuxin Liu|arXiv (Cornell University)|Jan 2, 2021
Reinforcement Learning in Robotics参考文献 40被引用 8
一句话总结

本文提出上下文感知安全强化学习(CASRL),一种元学习框架,通过使用概率潜在变量模型进行上下文感知的动力学预测以及不确定性感知的约束模型预测控制,实现在非平稳环境中的快速、安全适应。CASRL 通过整合先验安全约束和对罕见不安全转移的优先采样,在基线方法之上实现了更优的安全性和鲁棒性。

ABSTRACT

Safety is a critical concern when deploying reinforcement learning agents for realistic tasks. Recently, safe reinforcement learning algorithms have been developed to optimize the agent's performance while avoiding violations of safety constraints. However, few studies have addressed the non-stationary disturbances in the environments, which may cause catastrophic outcomes. In this paper, we propose the context-aware safe reinforcement learning (CASRL) method, a meta-learning framework to realize safe adaptation in non-stationary environments. We use a probabilistic latent variable model to achieve fast inference of the posterior environment transition distribution given the context data. Safety constraints are then evaluated with uncertainty-aware trajectory sampling. The high cost of safety violations leads to the rareness of unsafe records in the dataset. We address this issue by enabling prioritized sampling during model training and formulating prior safety constraints with domain knowledge during constrained planning. The algorithm is evaluated in realistic safety-critical environments with non-stationary disturbances. Results show that the proposed algorithm significantly outperforms existing baselines in terms of safety and robustness.

研究动机与目标

  • 解决在系统动力学因扰动而改变的非平稳、安全关键环境中,安全与适应性相互纠缠的挑战。
  • 利用上下文感知的潜在变量模型,实现对未见环境扰动的快速适应,支持在线推理。
  • 通过将领域知识作为先验安全约束引入,并对罕见不安全转移进行优先采样,提升在数据稀缺环境下的安全性。
  • 开发一种可扩展的风险厌恶控制框架,在高维任务中保持不确定性下的安全性。

提出的方法

  • 使用上下文感知的概率潜在变量模型,基于历史上下文数据推断环境转移分布,实现快速适应。
  • 采用不确定性感知的轨迹采样进行约束模型预测控制,确保规划过程中的安全性。
  • 整合源自领域知识的先验安全约束,以指导训练初期的保守探索。
  • 在模型训练中实施优先采样,以缓解因不安全轨迹稀缺导致的数据不平衡问题。
  • 利用元学习原则,实现在多样化非平稳扰动下的任务无关适应。
  • 结合在线贝叶斯推理与基于神经过程的动力学模型(ANP),实现高效、不确定性感知的预测。

实验结果

研究问题

  • RQ1强化学习智能体如何在具有时变扰动的非平稳环境中实现快速、安全的适应?
  • RQ2当训练数据中不安全轨迹极其稀少时,如何保证安全性?
  • RQ3先验领域知识和优先采样在高维、安全关键任务中,能在多大程度上提升学习效率和安全性?
  • RQ4与标准元学习或鲁棒强化学习方法相比,上下文感知动力学建模在安全性与鲁棒性方面表现如何?

主要发现

  • 与基线方法相比,CASRL 显著降低了安全违规率,尤其在医疗环境中高动态人类运动场景下表现突出。
  • 在未见扰动条件下,CASRL 在小车载摆动和医疗配送任务中均表现出低于 MAML 及其他基线方法的违规率。
  • 优先采样提升了不安全区域的预测准确性,同时未降低安全区域的性能,有效缓解了数据不平衡问题。
  • 预训练阶段至关重要:未进行预训练的 CASRL 在训练初期违规率急剧上升,凸显了先验安全约束的价值。
  • CASRL 在整个扰动空间中表现出强鲁棒性,热力图显示即使在极端扰动条件下,约束违规也极少。
  • 该方法在高维环境中具有良好的可扩展性,在标准元学习或鲁棒强化学习方法失效的场景中,仍能保持安全性和性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。