Skip to main content
QUICK REVIEW

[论文解读] Assembly robots with optimized control stiffness through reinforcement learning

Masahide Oikawa, Kyo Kutsuzawa|arXiv (Cornell University)|Feb 27, 2020
Robot Manipulation and Learning参考文献 22被引用 5
一句话总结

该论文提出了一种基于强化学习(RL)的方法,可在装配机器人的顺应控制中实时动态生成非对角线刚度矩阵,从而实现高精度的接触密集型任务,如插销入孔和齿轮插入。通过将刚度矩阵作为RL动作,该方法实现了平均执行时间低于2秒,性能比先前工作快50%,展现出快速响应和对不确定性的鲁棒性。

ABSTRACT

There is an increased demand for task automation in robots. Contact-rich tasks, wherein multiple contact transitions occur in a series of operations, are extensively being studied to realize high accuracy. In this study, we propose a methodology that uses reinforcement learning (RL) to achieve high performance in robots for the execution of assembly tasks that require precise contact with objects without causing damage. The proposed method ensures the online generation of stiffness matrices that help improve the performance of local trajectory optimization. The method has an advantage of rapid response owing to short sampling time of the trajectory planning. The effectiveness of the method was verified via experiments involving two contact-rich tasks. The results indicate that the proposed method can be implemented in various contact-rich manipulations. A demonstration video shows the performance. (https://youtu.be/gxSCl7Tp4-0)

研究动机与目标

  • 解决高精度、接触密集型机器人装配任务的挑战,即使存在机器人位置误差,也能实现亚毫米级精度。
  • 克服传统强化学习在机器人应用中的局限性,即动作输出周期过长,难以满足实时控制需求(通常>10–20 ms)。
  • 实现在线、自适应的刚度调节,提升局部轨迹优化性能,而无需改变参考轨迹。
  • 减少在复杂接触转换中对精确物理模型或预定义启发式规则的依赖。
  • 在真实世界实验中展示鲁棒性能,且仅需极少的真实世界试错数据,尤其适用于公差极严的任务(例如20 µm间隙)。

提出的方法

  • 该方法使用深度Q-learning生成作为动作的非对角线刚度矩阵,并直接应用于顺应控制模型。
  • 智能体基于实时的力/扭矩和位置反馈选择刚度矩阵,实现对接触状态的动态适应。
  • 动作空间包含五个非对角线刚度矩阵,其中一种专门设计用于齿轮插入过程中的旋转对齐。
  • 控制周期与机器人的实时控制回路同步,实现刚度更新的响应时间低于10 ms。
  • 该方法将轨迹规划与刚度自适应解耦,允许与标准轨迹规划器并行运行。
  • 该方法与机械柔顺解决方案(如远程中心柔顺)兼容,增强了对环境不确定性的鲁棒性。

实验结果

研究问题

  • RQ1强化学习能否在控制周期频率下(例如<10 ms)在线生成刚度矩阵,以实现在接触密集型任务中的实时自适应?
  • RQ2刚度矩阵的自适应如何在不修改参考轨迹的前提下提升局部轨迹优化?
  • RQ3RL智能体能否仅通过力/扭矩和位置反馈,学习选择能引导机器人实现正确对齐(例如孔中心对准)的刚度矩阵?
  • RQ4在高精度任务中,该方法在存在初始位置误差或零件错位等不确定性条件下表现如何?
  • RQ5相同的控制架构能否在极少重新配置的情况下处理多种接触密集型任务,如插销入孔和齿轮插入?

主要发现

  • 所提方法在0°倾斜角下实现插销入孔任务的平均执行时间为1.64秒,在2°倾斜角下为1.87秒,相比先前最先进方法减少50%。
  • 智能体成功基于力/扭矩反馈选择刚度矩阵,即使在孔位置未知且存在位置误差的情况下,也能引导插销向孔中心对齐。
  • 在齿轮插入任务中,机器人仅通过线性轨迹和可变刚度控制即实现成功对齐与插入,无需显式接触或旋转轨迹规划。
  • 插销入孔与齿轮插入任务在搜索与插入阶段的时间分布相似,表明该方法在接触密集型操作任务中具有良好的泛化能力。
  • 该方法在20 µm间隙和x-y方向±3 mm初始偏移下表现出鲁棒性,在100次试验中均保持一致的成功率。
  • 视频结果(https://youtu.be/gxSCl7Tp4-0)显示了稳定、实时的自适应过程和无需基于模型启发式规则的成功任务完成。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。