Skip to main content
QUICK REVIEW

[论文解读] Robust Constrained Reinforcement Learning for Continuous Control with Model Misspecification

Daniel J. Mankowitz, Dan A. Calian|arXiv (Cornell University)|Oct 20, 2020
Reinforcement Learning in Robotics参考文献 29被引用 4
一句话总结

该论文提出了R3C与RC强化学习目标,以解决连续控制中因模型误设而导致的约束性问题,即策略在面对训练时未见过的状态扰动时仍需保持鲁棒性并满足约束。通过构建鲁棒约束马尔可夫决策过程(Robust Constrained MDP)并定义相应的贝尔曼算子,该方法确保了收敛性,并在六个MuJoCo任务中相比基线方法提升了约束满足度与回报鲁棒性。

ABSTRACT

Many real-world physical control systems are required to satisfy constraints upon deployment. Furthermore, real-world systems are often subject to effects such as non-stationarity, wear-and-tear, uncalibrated sensors and so on. Such effects effectively perturb the system dynamics and can cause a policy trained successfully in one domain to perform poorly when deployed to a perturbed version of the same domain. This can affect a policy's ability to maximize future rewards as well as the extent to which it satisfies constraints. We refer to this as constrained model misspecification. We present an algorithm that mitigates this form of misspecification, and showcase its performance in multiple simulated Mujoco tasks from the Real World Reinforcement Learning (RWRL) suite.

研究动机与目标

  • 解决约束性模型误设(CMM)问题,即在理想环境中训练的策略在部署时遭遇未见状态扰动会失效。
  • 确保策略在部署于扰动环境时,既能抵御性能下降,也能避免违反约束。
  • 开发一个统一的强化学习框架,同时在不确定性下优化回报与约束满足。
  • 通过引入新的价值函数与贝尔曼算子定义,将鲁棒性扩展至最先进连续控制算法(D4PG、DMPO)中。

提出的方法

  • 提出一种鲁棒约束马尔可夫决策过程(RC-MDP)形式化,将状态转移中的不确定性建模为转移概率上的模糊集。
  • 定义两种新型强化学习目标:鲁棒回报鲁棒约束(R3C)与鲁棒约束(RC),分别在扰动环境中优化最坏情况下的回报与约束满足。
  • 引入R3C与RC的贝尔曼算子,确保在演员-critic算法中进行策略评估时收敛至不动点。
  • 在D4PG与DMPO基础上实现R3C与RC的算法变体,将鲁棒价值函数更新整合至策略评估步骤中。
  • 采用拉格朗日松弛方法来强制约束,通过动态调整拉格朗日乘子以平衡约束违反与回报最大化。
  • 使用一组保留的扰动环境作为评估集,模拟在未知扰动下的真实部署场景。

实验结果

研究问题

  • RQ1强化学习智能体能否在训练期间未见过的状态扰动下,仍保持约束满足?
  • RQ2对回报与约束满足进行鲁棒优化,如何影响在模型误设情况下的学习稳定性与性能?
  • RQ3所提出的R3C与RC目标是否能生成比标准约束强化学习更具泛化能力的策略,以应对未见的扰动环境?
  • RQ4鲁棒性是否导致约束过严——是否会引发过度保守的行为?
  • RQ5在优化鲁棒约束满足的过程中,拉格朗日乘子在训练期间的行为如何?

主要发现

  • 在六个MuJoCo任务中,R3C-DMPO与RC-DMPO算法在标准环境与保留的扰动环境中均显著优于所有基线方法,保持了更高的约束满足度。
  • 鲁棒变体(R3C-DMPO、RC-DMPO)在保留测试集上的约束回报(J_C^π)显著更优,表明其对未见扰动具有更强的鲁棒性。
  • 非鲁棒基线方法(如C-DMPO与R-DMPO)尽管在标准训练环境中表现良好,但在保留的扰动环境中无法满足约束。
  • 即使在标准环境中约束已满足,鲁棒算法的拉格朗日乘子仍保持非零,表明在不确定性下仍持续执行约束强制。
  • 学习曲线显示,鲁棒算法收敛至更保守的约束处理策略,约束回报始终低于阈值β,提示可能存在过度保守现象。
  • 所提出的R3C与RC贝尔曼算子能够收敛至不动点,验证了该方法的理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。