[论文解读] Constrained Model-based Reinforcement Learning with Robust Cross-Entropy Method
本文提出了一种基于约束的模型强化学习算法,采用鲁棒交叉熵方法(RCE)在模型不确定性和稀疏约束违规信号下优化控制序列。通过将不确定性感知的神经网络集成与模型预测控制相结合,该方法在Safety Gym基准测试中实现了近乎零的约束违规,并展现出优越的样本效率,优于当前最先进的无模型和基于模型的基线方法。
This paper studies the constrained/safe reinforcement learning (RL) problem with sparse indicator signals for constraint violations. We propose a model-based approach to enable RL agents to effectively explore the environment with unknown system dynamics and environment constraints given a significantly small number of violation budgets. We employ the neural network ensemble model to estimate the prediction uncertainty and use model predictive control as the basic control framework. We propose the robust cross-entropy method to optimize the control sequence considering the model uncertainty and constraints. We evaluate our methods in the Safety Gym environment. The results show that our approach learns to complete the tasks with a much smaller number of constraint violations than state-of-the-art baselines. Additionally, we are able to achieve several orders of magnitude better sample efficiency when compared with constrained model-free RL approaches. The code is available at \url{https://github.com/liuzuxin/safe-mbrl}.
研究动机与目标
- 开发一种无需事先了解系统动力学或约束函数的约束型模型强化学习算法。
- 解决在约束违规指示信号稀疏且不可靠样本有限的条件下学习安全策略的挑战。
- 在无法获得解析约束表达式的高维观测空间中,提升样本效率和约束满足度。
- 设计一种对模型不确定性具有鲁棒性的优化方法,防止训练过程中出现不安全的策略更新。
- 在安全关键环境中实现接近最优的任务性能,同时将约束违规降至最低。
提出的方法
- 使用神经网络集成来估计动力学模型中的预测不确定性,从而实现不确定性感知的规划。
- 采用模型预测控制(MPC)作为控制框架,在有限时域内优化控制序列。
- 引入鲁棒交叉熵(RCE)方法,通过仅选择安全的精英样本优化动作序列,减少不安全轨迹带来的偏差。
- RCE在分布更新过程中丢弃不安全样本,而标准CEM则包含被惩罚的不安全样本,因此RCE在安全性方面表现更优。
- 通过利用不确定性估计和约束指示信号,联合优化任务奖励与约束满足度。
- 该算法在约束马尔可夫决策过程(CMDP)框架下运行,无需假设动力学或约束的解析表达式已知。
实验结果
研究问题
- RQ1当动力学和约束均未知时,基于模型的强化学习方法是否能实现高任务性能并接近零的约束违规?
- RQ2与标准CEM和无模型基线相比,鲁棒交叉熵(RCE)在安全性和样本效率方面有何改进?
- RQ3在约束反馈稀疏的环境中,不确定性感知的动力学模型在多大程度上能减少不安全探索?
- RQ4当目标违规预算受限时,所提方法在约束满足度和任务奖励方面与基线相比表现如何?
- RQ5在高维感官观测下,当解析约束函数不可行时,RCE能否保持性能?
主要发现
- 在Point Goal 1任务中,MPC-RCE在前10,000次训练步骤中仅发生16.00次约束违规,显著低于MPC-CEM(184.33)和MPC-random(169.0)。
- 在Car Goal 2任务中,MPC-RCE发生96.00次违规,而MPC-CEM为578.00次,MPC-random为509.33次,表明其安全性更优。
- 与约束型无模型强化学习方法相比,该方法的样本效率高出几个数量级,后者需要大量不可靠样本。
- RCE通过避免采样分布中的偏差优于CEM:CEM使用被惩罚的不安全精英样本,导致后期迭代中不安全动作增加。
- 该方法在保持与较不安全方法相当的任务奖励的同时,显著降低了约束违规次数,因此适用于安全关键场景的部署。
- 结果证实,在违规预算有限的情况下,RCE在最小化约束违规方面比标准CEM和无模型方法更有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。