[论文解读] Robust Constrained-MDPs: Soft-Constrained Robust Policy Optimization under Model Uncertainty
本文提出了一种新型框架——鲁棒约束马尔可夫决策过程(Robust Constrained-MDPs, RCMDPs),将约束马尔可夫决策过程(CMDPs)与鲁棒马尔可夫决策过程(RMDPs)统一,以在模型不确定性下同时确保性能鲁棒性和约束满足。该框架引入了一种基于拉格朗日乘子的策略梯度算法,优化最坏情况下的性能与累积约束成本,在库存管理任务中表现出更优的安全性与鲁棒性,且在转移概率存在不确定性时仍能保证约束的严格遵守。
In this paper, we focus on the problem of robustifying reinforcement learning (RL) algorithms with respect to model uncertainties. Indeed, in the framework of model-based RL, we propose to merge the theory of constrained Markov decision process (CMDP), with the theory of robust Markov decision process (RMDP), leading to a formulation of robust constrained-MDPs (RCMDP). This formulation, simple in essence, allows us to design RL algorithms that are robust in performance, and provides constraint satisfaction guarantees, with respect to uncertainties in the system's states transition probabilities. The need for RCMPDs is important for real-life applications of RL. For instance, such formulation can play an important role for policy transfer from simulation to real world (Sim2Real) in safety critical applications, which would benefit from performance and safety guarantees which are robust w.r.t model uncertainty. We first propose the general problem formulation under the concept of RCMDP, and then propose a Lagrangian formulation of the optimal problem, leading to a robust-constrained policy gradient RL algorithm. We finally validate this concept on the inventory management problem.
研究动机与目标
- 为解决模型无关及非鲁棒模型基强化学习在安全关键应用中缺乏鲁棒性与约束满足的问题。
- 通过提出统一的RCMDP形式化,弥合约束马尔可夫决策过程(CMDPs)——通过成本约束确保安全性——与鲁棒马尔可夫决策过程(RMDPs)——处理模型不确定性——之间的差距。
- 开发一种策略梯度算法,确保在最坏情况转移概率下仍具备鲁棒性能与约束满足能力。
- 在存在模型不确定性与严格安全约束的真实世界库存管理问题上验证该方法的有效性。
提出的方法
- 通过将CMDP的约束与RMDP的最坏情况鲁棒性相结合,利用转移概率的模糊集构建RCMDPs。
- 推导出拉格朗日对偶形式,以在最坏情况模型扰动下联合优化性能与约束满足。
- 提出一种双时间尺度随机策略梯度算法:快速更新策略参数θ,慢速更新拉格朗日乘子λ。
- 通过在模糊集上最小化,计算每个状态-动作对的最坏情况转移概率,以确保鲁棒性。
- 采用蒙特卡洛轨迹采样,结合名义转移与最坏情况转移,以估计策略与约束目标的梯度。
- 采用标准随机逼近条件保证收敛性,并通过时间尺度分离实现θ与λ更新的独立性。
实验结果
研究问题
- RQ1能否构建一个统一框架,在模型不确定性下同时保证鲁棒性能与约束满足?
- RQ2如何将CMDPs的拉格朗日松弛方法扩展,以纳入转移动态中的最坏情况模型扰动?
- RQ3所提出的鲁棒-约束策略梯度算法是否能在提升最坏情况性能的同时,保持约束满足,相较于非鲁棒或无约束基线方法?
- RQ4该算法能否有效应对安全关键应用中存在不确定模拟到现实(Sim2Real)动态的迁移问题?
主要发现
- 在库存管理问题中,鲁棒-约束策略梯度算法的期望回报高于鲁棒-无约束变体,表明在约束条件下性能得到提升。
- 尽管因最坏情况规划导致期望回报略有下降,鲁棒-约束方法在鲁棒性与安全性方面仍优于非鲁棒-无约束基线。
- 该算法在所有回合中均成功执行了约束预算,证明在模型不确定性下具备可靠的约束满足能力。
- 非鲁棒-无约束基线虽然获得了更高的期望回报,但缺乏安全保证,凸显了性能与鲁棒性之间的权衡。
- 双时间尺度更新机制确保了收敛至局部鞍点,符合标准随机逼近理论的支持。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。