Skip to main content
QUICK REVIEW

[论文解读] Safe Model-based Reinforcement Learning with Robust Cross-Entropy Method.

Zuxin Liu, Hongyi Zhou|arXiv (Cornell University)|Oct 15, 2020
Reinforcement Learning in Robotics参考文献 13被引用 8
一句话总结

本文提出一种基于安全模型的强化学习方法,利用不确定性感知的神经网络集成来建模动力学并从违反信号中推断约束。该方法在模型预测控制框架内采用鲁棒交叉熵方法,以在模型不确定性下优化控制序列,在Safety Gym环境中的约束满足度和样本效率方面优于基线方法。

ABSTRACT

This paper studies the safe reinforcement learning (RL) problem without assumptions about prior knowledge of the system dynamics and the constraint function. We employ an uncertainty-aware neural network ensemble model to learn the dynamics, and we infer the unknown constraint function through indicator constraint violation signals. We use model predictive control (MPC) as the basic control framework and propose the robust cross-entropy method (RCE) to optimize the control sequence considering the model uncertainty and constraints. We evaluate our methods in the Safety Gym environment. The results show that our approach achieves better constraint satisfaction than baseline safe RL methods while maintaining good task performance. Additionally, we are able to achieve several orders of magnitude better sample efficiency when compared to constrained model-free RL approaches. The code is available at this https URL.

研究动机与目标

  • 解决在缺乏系统动力学或约束函数先验知识情况下的安全强化学习问题。
  • 开发一种能够同时处理模型不确定性和安全约束的基于模型的强化学习框架。
  • 相比约束型模型自由强化学习方法,提升样本效率。
  • 仅使用二值违反信号,在连续控制环境中实现高约束满足度。

提出的方法

  • 使用神经网络集成来学习系统动力学并量化不确定性。
  • 从约束违反的二值指示信号中推断未知的约束函数。
  • 将模型预测控制(MPC)作为顺序决策的控制框架。
  • 引入鲁棒交叉熵方法(RCE)以在模型不确定性和安全约束下优化控制序列。
  • 利用不确定性估计在尊重安全约束的前提下稳健地探索控制动作。
  • 结合不确定性感知的动力学建模与约束推断,以指导安全探索与控制。

实验结果

研究问题

  • RQ1基于模型的强化学习方法是否能在缺乏系统动力学或约束函数先验知识的情况下实现安全控制?
  • RQ2仅从二值违反信号中,约束函数的推断效果如何?
  • RQ3不确定性感知建模在安全强化学习中对约束满足度的提升程度如何?
  • RQ4与模型自由约束强化学习基线相比,所提出的基于RCE的MPC在样本效率方面表现如何?
  • RQ5在模型不确定性下进行鲁棒优化,是否能带来更优的安全与性能权衡?

主要发现

  • 所提方法在Safety Gym基准测试中,显著优于基线安全强化学习方法的约束满足度。
  • 该方法在不依赖动力学或约束先验知识的情况下,仍能保持强大的任务性能并确保安全性。
  • 与约束型模型自由强化学习基线相比,其样本效率提升了数个数量级。
  • 使用不确定性感知的集成模型显著提升了控制优化过程中对模型不准确性的鲁棒性。
  • 鲁棒交叉熵方法在模型不确定性下有效平衡了探索与安全性。
  • 仅从二值信号中推断约束已足够在复杂环境中引导安全策略学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。