Skip to main content
QUICK REVIEW

[论文解读] Learning Constraints from Demonstrations

Glen Chou, Dmitry Berenson|arXiv (Cornell University)|Dec 17, 2018
Fault Detection and Control Systems参考文献 30被引用 17
一句话总结

本文提出一种方法,通过安全示范、系统动力学和代价函数,学习机器人任务之间的共享未知约束。通过从示范中采样低代价(不安全)轨迹并求解逆整数规划,该方法可恢复不安全集合的保证下近似,适用于线性和非线性动力学,并可推广至特征空间。

ABSTRACT

We extend the learning from demonstration paradigm by providing a method for learning unknown constraints shared across tasks, using demonstrations of the tasks, their cost functions, and knowledge of the system dynamics and control constraints. Given safe demonstrations, our method uses hit-and-run sampling to obtain lower cost, and thus unsafe, trajectories. Both safe and unsafe trajectories are used to obtain a consistent representation of the unsafe set via solving an integer program. Our method generalizes across system dynamics and learns a guaranteed subset of the constraint. We also provide theoretical analysis on what subset of the constraint can be learnable from safe demonstrations. We demonstrate our method on linear and nonlinear system dynamics, show that it can be modified to work with suboptimal demonstrations, and that it can also be used to learn constraints in a feature space.

研究动机与目标

  • 解决在无显式编程的情况下,从多个机器人任务中学习共享潜在约束的挑战。
  • 仅通过示范和已知系统动力学,使机器人能够泛化安全约束以适应不同任务。
  • 提供一种理论基础坚实的方法,保证从安全示范中恢复出真实不安全集合的一个子集。
  • 将约束学习从状态空间和轨迹空间扩展至抽象特征空间,例如移动机器人导航中的地形坡度。
  • 通过基于代价相对于示范的相对性,为子最优示范分配概率安全标签,提升对真实人类行为的鲁棒性。

提出的方法

  • 利用安全最优示范,通过随机采样生成低代价轨迹,假设其违反未知约束。
  • 确保采样轨迹满足已知约束(动力学、控制极限、起始/目标条件),以保持可行性。
  • 构建一个逆整数规划,利用安全和不安全轨迹推断不安全集合的一致表示。
  • 将不安全集合表示为离散化约束空间(如状态、特征或轨迹空间)中若干超矩形的并集。
  • 通过理论分析,确定基于轨迹离散化、动力学和示范覆盖范围的可学习性边界。
  • 通过基于代价相对于示范的相对性,为子最优示范分配概率安全标签,以适应子最优示范。

实验结果

研究问题

  • RQ1在已知系统动力学和代价函数的前提下,从安全最优示范中可可靠学习到不安全约束的哪一子集?
  • RQ2如何在特征空间(如地形坡度)中学习约束,而不仅限于状态或轨迹空间?
  • RQ3该方法能否在不同系统动力学(包括线性和非线性系统,如Dubins小车)之间实现泛化?
  • RQ4该方法如何处理子最优人类示范,其对学习约束准确性的潜在影响是什么?
  • RQ5对真实不安全集合的下近似存在哪些理论保证,其依赖于轨迹离散化和示范多样性的方式如何?

主要发现

  • 该方法即使仅使用少量示范,也能成功恢复真实不安全集合的保证下近似,适用于单积分器和双积分器动力学。
  • 在Dubins小车模型中,该方法恢复了不安全集合的显著部分,且随着示范多样性的增加,性能持续提升。
  • 在子最优示范实验中,该方法保持理论保证,尽管采用概率标签,学习到的不安全集合仍为真实不安全区域的子集。
  • 该方法在特征空间中实现了地形坡度约束的精确恢复,仅从一个RRT*-生成的示范中学习到阈值 $φ(x) < 0.05$。
  • 学习性能受限于轨迹离散化和示范覆盖范围;在无捷径路径通过高代价区域的区域,仍无法学习。
  • 由于标签不确定性,子最优设置下的MSE增加,但该方法仍能产生有效且保守的不安全集合下近似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。