Skip to main content
QUICK REVIEW

[论文解读] Learning Soft Constraints From Constrained Expert Demonstrations

Gaurav Ashish, Kasra Rezaee|arXiv (Cornell University)|Jun 2, 2022
Reinforcement Learning in Robotics被引用 4
一句话总结

本文提出了一种新颖的逆约束学习(ICL)方法,可在已知奖励函数的前提下,从专家演示中恢复累积软约束——即在期望下满足而非在每一步严格满足的约束——并基于约束马尔可夫决策过程(CMDP)框架与迭代优化,学习灵活的神经网络约束函数,该方法在合成环境、机器人控制及真实世界高速公路驾驶场景中均表现出高精度与强噪声鲁棒性。

ABSTRACT

Inverse reinforcement learning (IRL) methods assume that the expert data is generated by an agent optimizing some reward function. However, in many settings, the agent may optimize a reward function subject to some constraints, where the constraints induce behaviors that may be otherwise difficult to express with just a reward function. We consider the setting where the reward function is given, and the constraints are unknown, and propose a method that is able to recover these constraints satisfactorily from the expert data. While previous work has focused on recovering hard constraints, our method can recover cumulative soft constraints that the agent satisfies on average per episode. In IRL fashion, our method solves this problem by adjusting the constraint function iteratively through a constrained optimization procedure, until the agent behavior matches the expert behavior. We demonstrate our approach on synthetic environments, robotics environments and real world highway driving scenarios.

研究动机与目标

  • 为解决现有逆强化学习(IRL)方法无法恢复约束的局限性,特别是在安全关键应用中约束至关重要这一问题。
  • 学习累积软约束——即单条轨迹中允许违反,但期望下受约束——而非必须在每条轨迹中都满足的硬约束。
  • 开发一种适用于任意状态-动作空间(包括连续空间)的方法,并学习灵活的神经网络约束函数。
  • 在多样化环境中(包括合成任务、机器人控制与真实世界高速公路驾驶场景)验证该方法的有效性。
  • 提供一种比仅建模奖励更可解释、更鲁棒的替代方案,通过学习反映安全与运行限制的约束。

提出的方法

  • 该方法在约束马尔可夫决策过程(CMDP)框架内构建逆约束学习,其中智能体在满足期望累积约束值约束的前提下最大化期望奖励。
  • 采用迭代约束优化过程调整神经网络约束函数,直至智能体行为与专家演示相匹配。
  • 约束函数参数化为深度神经网络,并通过可微优化过程训练,以最小化专家与智能体在约束累积上的差异。
  • 该方法采用类似于IRL的对偶优化方案,根据轨迹上专家与智能体约束值之间的差异更新约束函数。
  • 该方法对专家数据中的噪声和轻微违反具有鲁棒性,因其仅在期望下强制约束,而非逐轨迹强制。
  • 支持连续状态-动作空间,并可在包括机器人运动与高速公路驾驶等复杂动力学环境中的多样化环境中泛化。

实验结果

研究问题

  • RQ1逆约束学习能否恢复在期望下满足而非每一步都严格满足的软约束?
  • RQ2基于神经网络的约束函数在多样化环境(包括连续控制与真实世界驾驶场景)中的泛化能力如何?
  • RQ3所提出的方法在约束准确性与行为模仿方面是否优于现有ICL方法?
  • RQ4该方法对专家演示中的噪声与轻微违反的鲁棒性如何?
  • RQ5所学习的约束是否具有可解释性,并可用于提升真实世界应用中的安全性?

主要发现

  • 该方法在合成环境(如Gridworld与CartPole)中成功恢复了软约束,在多种配置下均实现了接近零的约束均方误差(CMSE)。
  • 在Ant与Half-Cheetah环境中,该方法分别实现了CMSE值0.01 ± 0.00与0.01 ± 0.00,表明约束恢复具有高保真度。
  • 在HighD与ExiD高速公路驾驶场景中,该方法学习到了与速度与车距控制相关的有意义约束,其归一化累积值与专家行为高度一致。
  • 该方法对专家数据中的噪声与轻微违反表现出鲁棒性,因其仅在期望下强制约束,而非逐轨迹强制。
  • 训练曲线显示,在5个随机种子下,约束函数与累积值均表现出一致收敛,表明学习过程稳定。
  • 该方法在约束函数准确性与行为模仿方面优于基线方法(如GAIL-Constraint与ICRL),尤其在复杂环境中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。