Skip to main content
QUICK REVIEW

[论文解读] Learning Safety Constraints from Demonstrations with Unknown Rewards

David Lindner, Xin Chen|arXiv (Cornell University)|May 25, 2023
Reinforcement Learning in Robotics被引用 4
一句话总结

本文提出 CoCoRL,一种新颖方法,用于在奖励函数未知且环境动态未知的情况下,从演示中学习约束马尔可夫决策过程(CMDPs)中的安全约束。通过从多样化且可能次优的演示中构建凸安全集,CoCoRL 确保了安全性,并实现了近似最优策略的渐近最优性,优于无法保证安全性的基于 IRL 的基线方法。

ABSTRACT

We propose Convex Constraint Learning for Reinforcement Learning (CoCoRL), a novel approach for inferring shared constraints in a Constrained Markov Decision Process (CMDP) from a set of safe demonstrations with possibly different reward functions. While previous work is limited to demonstrations with known rewards or fully known environment dynamics, CoCoRL can learn constraints from demonstrations with different unknown rewards without knowledge of the environment dynamics. CoCoRL constructs a convex safe set based on demonstrations, which provably guarantees safety even for potentially sub-optimal (but safe) demonstrations. For near-optimal demonstrations, CoCoRL converges to the true safe set with no policy regret. We evaluate CoCoRL in gridworld environments and a driving simulation with multiple constraints. CoCoRL learns constraints that lead to safe driving behavior. Importantly, we can safely transfer the learned constraints to different tasks and environments. In contrast, alternative methods based on Inverse Reinforcement Learning (IRL) often exhibit poor performance and learn unsafe policies.

研究动机与目标

  • 解决在奖励函数未知且环境动态不可观测时,学习 CMDP 中安全约束的挑战。
  • 开发一种即使在次优但安全的演示下也能保证安全性的方法。
  • 在不依赖已知奖励或动态信息的前提下,实现对近似最优演示的渐近最优性。
  • 实现所学约束在不同任务和环境间的迁移能力。
  • 证明基于 IRL 的方法在此类设置下无法保证安全性。

提出的方法

  • CoCoRL 利用演示在特征空间中构建凸安全集,确保该集合内的所有策略均满足共享约束。
  • 将约束推理形式化为对演示轨迹占用度量的凸优化问题。
  • 利用安全策略必须位于由约束定义的半空间交集内的事实,形成凸多面体。
  • 对于近似最优的演示,CoCoRL 通过理论分析证明可无策略遗憾地收敛至真实安全集。
  • 该方法无需了解环境的转移动态或演示者的奖励函数。
  • 该方法在表格型环境和具有多个约束的连续驾驶模拟环境中进行了评估。

实验结果

研究问题

  • RQ1当底层奖励函数未知时,能否可靠地从演示中推断出安全约束?
  • RQ2在演示次优的情况下,约束学习方法能否仍保证安全性?
  • RQ3在未获知动态或奖励信息的前提下,该方法能否实现对近似最优演示的渐近最优性?
  • RQ4CoCoRL 与基于 IRL 的基线方法在安全性和性能方面相比如何?
  • RQ5所推断的约束能否成功迁移到新任务和新环境中?

主要发现

  • CoCoRL 确保了从推断的凸安全集导出的所有策略的安全性,在实验中未观察到任何不安全解。
  • 在单状态 CMDP 中,CoCoRL 仅需少量演示即可获得高回报,并且随着演示数量增加,会收敛至最优策略。
  • CoCoRL 的样本复杂度与特征维度成比例,符合定理 3 的预测,但对真实约束数量的敏感度较低。
  • 所有基于 IRL 的基线方法——包括最大熵和最大间隔变体——均无法保证安全性,在网格世界和驾驶环境中均返回了不安全策略。
  • 在驾驶模拟中,CoCoRL 有效学习了导致安全驾驶行为的约束,并成功泛化至新任务和新环境,而 IRL 基线方法则违反约束且表现较差。
  • 即使已知奖励的 IRL 基线(可访问真实奖励)仍无法保证安全性,表明 IRL 无法依赖于安全关键的应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。