Skip to main content
QUICK REVIEW

[论文解读] Inverse Constrained Reinforcement Learning

Usman Anwar, Shehryar Malik|arXiv (Cornell University)|Nov 19, 2020
Reinforcement Learning in Robotics参考文献 32被引用 7
一句话总结

本文提出了一种无模型、基于样本的逆约束强化学习框架,可在连续、高维环境中从专家示范中推断任意马尔可夫约束。通过使用重要性采样和基于KL的早停技术将约束恢复问题形式化为学习问题,该方法成功地将学习到的约束迁移至具有不同形态或奖励函数的新智能体,实现安全的专家级性能,且无需假设环境动态特性。

ABSTRACT

In real world settings, numerous constraints are present which are hard to specify mathematically. However, for the real world deployment of reinforcement learning (RL), it is critical that RL agents are aware of these constraints, so that they can act safely. In this work, we consider the problem of learning constraints from demonstrations of a constraint-abiding agent's behavior. We experimentally validate our approach and show that our framework can successfully learn the most likely constraints that the agent respects. We further show that these learned constraints are extit{transferable} to new agents that may have different morphologies and/or reward functions. Previous works in this regard have either mainly been restricted to tabular (discrete) settings, specific types of constraints or assume the environment's transition dynamics. In contrast, our framework is able to learn arbitrary extit{Markovian} constraints in high-dimensions in a completely model-free setting. The code can be found it: \url{https://github.com/shehryar-malik/icrl}.

研究动机与目标

  • 为解决在强化学习中数学形式化现实世界约束的挑战,特别是当这些约束为隐式或难以形式化时。
  • 在不假设已知环境转移动态的前提下,从专家示范中实现约束推断,克服先前工作中存在的局限性。
  • 开发一种方法,可在高维连续状态和动作空间中学习任意马尔可夫约束,突破传统表格或离散设置的限制。
  • 将学习到的约束迁移至具有不同形态或奖励函数的新智能体,确保在新环境中实现安全且专家级的行为。
  • 通过从专家行为中推断约束,防止奖励欺骗和不安全行为,即使名义奖励函数本身会导致不安全策略。

提出的方法

  • 该方法通过基于样本的方法近似Scobee & Sastry (2020)的客观函数,将逆约束强化学习形式化为学习问题,实现无模型学习。
  • 采用重要性采样对专家轨迹进行重加权,提升从示范中估计约束似然性的准确性。
  • 使用基于KL的早停技术防止优化过程中的过拟合,确保稳定收敛至最可能的约束。
  • 该框架学习形式为 $ c(\tau) = \prod_{t=1}^{T} c(s_t, a_t) $ 的约束函数,其中约束仅依赖于当前状态-动作对,使其具备马尔可夫性。
  • 该方法为端到端完全可微,无需事先了解环境的转移动态或奖励函数。
  • 将学习到的约束与名义奖励函数集成,训练出在实际部署中尊重安全约束的智能体。

实验结果

研究问题

  • RQ1在不假设已知转移动态的前提下,能否成功地从连续、高维环境中的专家示范中推断约束?
  • RQ2推断出的约束能否泛化至具有不同形态或奖励函数的新智能体?
  • RQ3该方法在防止现实环境中不安全行为(如奖励欺骗或约束违反)方面的有效性如何?
  • RQ4重要性采样和早停技术在提升约束恢复的稳定性与性能方面发挥何种作用?
  • RQ5该方法能否仅从行为数据中学习任意马尔可夫约束,包括复杂、非几何或非凸的约束?

主要发现

  • 所提出的方法即使在环境动态未知的情况下,也能成功学习专家智能体所遵守的最可能的约束。
  • 学习到的约束能有效泛化至具有不同形态和奖励函数的新智能体,在新环境中实现专家级性能。
  • 消融实验表明,重要性采样和基于KL的早停技术对性能至关重要,禁用任一方法均导致奖励显著下降及约束违反增加。
  • 在HalfCheetah环境中,该方法实现了接近专家水平的性能,且约束违反极少,优于行为克隆和基于模仿的基线方法(后者约束设置过于激进)。
  • 该方法通过学习避免不安全轨迹(如经过有狮子的路径),有效防止了奖励欺骗,即使名义奖励函数会激励此类行为。
  • 该框架在高维连续控制任务中表现出良好的可扩展性,证明了其在现实强化学习部署中的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。