Skip to main content
QUICK REVIEW

[论文解读] Do What I Want, Not What I Did: Imitation of Skills by Planning Sequences of Actions

Chris Paxton, Felix Jonathan|arXiv (Cornell University)|Dec 5, 2016
Robot Manipulation and Learning参考文献 27被引用 4
一句话总结

本文提出了一种任务与运动规划框架,该框架从专家示范中学习高层动作,并利用基于采样的规划方法在新环境中生成稳健且可适应的动作序列。通过将动作建模为运动特征的概率分布,并将其与符号化任务规划相结合,该系统在仿真和真实世界实验中均实现了精确、避障的装配操作,实验对象为UR5机械臂。

ABSTRACT

We propose a learning-from-demonstration approach for grounding actions from expert data and an algorithm for using these actions to perform a task in new environments. Our approach is based on an application of sampling-based motion planning to search through the tree of discrete, high-level actions constructed from a symbolic representation of a task. Recursive sampling-based planning is used to explore the space of possible continuous-space instantiations of these actions. We demonstrate the utility of our approach with a magnetic structure assembly task, showing that the robot can intelligently select a sequence of actions in different parts of the workspace and in the presence of obstacles. This approach can better adapt to new environments by selecting the correct high-level actions for the particular environment while taking human preferences into account.

研究动机与目标

  • 使机器人能够将示范技能泛化到存在障碍物和不同物体构型的新环境中。
  • 通过将高层动作建立在学习到的运动分布基础上,弥合符号化任务规划与连续运动规划之间的鸿沟。
  • 通过整合人类偏好和实时环境约束,提高规划的可靠性和适应性。
  • 在真实世界的磁性结构装配任务中,使用UR5机械臂验证该方法的有效性。

提出的方法

  • 动作被建模为从专家示范中学习到的运动特征(例如,相对位置/姿态)的概率分布。
  • 递归的基于采样的运动规划器在尊重环境约束的前提下,探索符号化动作在连续空间中的实例化。
  • 采用重要性采样和交叉熵方法重新估计动作分布,以满足新约束(例如障碍物),同时保留先验知识。
  • 符号状态之间的转移概率被建模为离散分布,以在规划过程中指导动作选择。
  • 产品模型结合了学习到的动作模型和转移模型,实现多步任务规划,并支持多种有效解。
  • 规划器选择的动作序列在最小化与示范行为偏差的同时,满足新环境的约束条件。

实验结果

研究问题

  • RQ1机器人如何将示范动作泛化到存在障碍物和不同物体位姿的新环境中?
  • RQ2从示范中学到的概率动作模型是否能够在新场景中支持可靠且自适应的任务规划?
  • RQ3集成前瞻搜索和动作选项如何提升规划质量和成功率?
  • RQ4在多大程度上可以将人类偏好和环境约束编码到学习到的动作模型中以指导规划?

主要发现

  • 在仿真中,包含选项和前瞻搜索的完整算法实现了小于1 cm的装配误差,证明了极高的配合精度。
  • 在无障碍物环境中,完整算法在100%的试验中成功,当仅使用专家数据训练时失败0次,当使用机器人生成的数据增强后也失败0次。
  • 若不使用前瞻搜索或选项,成功率显著下降:仅使用专家数据时失败7次,使用额外机器人生成数据时失败3次。
  • 在真实世界实验中,系统成功适应了新构型,能够根据对齐情况和障碍物存在,正确选择抓取对象(连接件或节点)。
  • 性能随着额外示范数据的增加而提升,且完整算法相比基线方法更具灵活性和可靠性。
  • 规划器通过选择替代且可行的轨迹避开了障碍物,同时保持与教学动作偏好的一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。