Skip to main content
QUICK REVIEW

[论文解读] Residual Learning from Demonstration: Adapting Dynamic Movement Primitives for Contact-rich Insertion Tasks

Todor Davchev, Kevin Sebastian Luck|arXiv (Cornell University)|Aug 18, 2020
Robot Manipulation and Learning参考文献 33被引用 8
一句话总结

该论文提出了一种残差学习演示(rLfD)框架,通过结合行为克隆与基于强化学习的残差校正策略,增强动态运动基元(DMPs)在高接触力插入任务中的表现。该方法直接在完整机器人位姿的任务空间中运行,显著提升了DMP在模拟和真实世界中插销、齿轮和插头插入任务下的性能、泛化能力与成功率。

ABSTRACT

Contacts and friction are inherent to nearly all robotic manipulation tasks. Through the motor skill of insertion, we study how robots can learn to cope when these attributes play a salient role. In this work we study ways for adapting dynamic movement primitives (DMP) to improve their performance in the context of contact rich insertion. We propose a framework we refer to as residual learning from demonstration (rLfD) that combines dynamic movement primitives (DMP) that rely on behavioural cloning with a reinforcement learning (RL) based residual correction policy. Our evaluation suggests that applying residual learning directly in task space and operating on the full pose of the robot can significantly improve the overall performance of DMPs. We show that rLfD outperforms alternatives and improves the generalisation abilities of DMPs. We evaluate this approach by training an agent to successfully perform both simulated and real world insertions of pegs, gears and plugs into respective sockets.

研究动机与目标

  • 解决在摩擦力和接触力至关重要的高接触力环境中学习鲁棒插入行为的挑战。
  • 提升动态运动基元(DMPs)在涉及不同几何形状与接触动力学的复杂插入任务中应用时的泛化能力与鲁棒性。
  • 开发一种混合学习框架,结合模仿学习(行为克隆)与强化学习,实现实时校正DMP轨迹。
  • 实现高接触敏感度插入任务从仿真到真实世界执行的有效迁移。
  • 证明在完整位姿空间中进行残差校正相较于其他方法在成功率与鲁棒性方面表现更优。

提出的方法

  • 该框架结合通过行为克隆在示范轨迹上训练的DMP策略,以提供基础运动策略。
  • 利用强化学习训练残差校正策略,根据任务空间误差与接触反馈实时修改DMP输出。
  • 残差策略直接在机器人末端执行器的完整6D位姿(位置与姿态)的任务空间中运行,实现在接触交互过程中的精确校正。
  • 残差校正在线执行期间应用,使策略能够动态适应接触力与与标称轨迹的偏差。
  • 该方法采用奖励塑形策略,鼓励成功插入,同时惩罚过大偏差与过大的接触力。
  • 该框架在仿真中端到端训练,并以极少的领域随机化或微调直接迁移到真实世界硬件。

实验结果

研究问题

  • RQ1通过强化学习训练的残差校正策略是否能显著提升DMP在高接触力插入任务中的成功率?
  • RQ2在完整任务空间位姿空间中运行残差策略是否相比关节空间或部分位姿校正带来更好的性能与泛化能力?
  • RQ3与标准DMP及其它模仿学习+强化学习基线方法相比,rLfD在不同插入几何形状下的鲁棒性与成功率如何?
  • RQ4rLfD框架在无需大量微调的情况下,其在仿真到真实世界迁移中的泛化能力有多强?
  • RQ5残差校正策略是否能有效应对插入过程中可变的接触动力学与几何不匹配?

主要发现

  • 与仅通过行为克隆训练的标准DMP相比,rLfD框架显著提升了插入成功率。
  • 在完整位姿空间中进行残差校正,相比关节空间或部分位姿校正,在不同插入任务(插销、齿轮、插头)中展现出更优的泛化能力。
  • 该方法在仿真与真实世界实验中均实现了高成功率,证明了有效的仿真到真实世界迁移能力。
  • 强化学习驱动的残差校正集成使智能体能够在执行过程中适应接触力与几何变化,减少故障模式。
  • 在多种插入场景下,该方法在鲁棒性与成功率方面优于其他模仿学习+强化学习基线方法。
  • 残差策略有效减少了轨迹偏差与接触力尖峰,实现了更平滑、更可靠的插入。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。