Skip to main content
QUICK REVIEW

[论文解读] A Learning Framework for High Precision Industrial Assembly

Yongxiang Fan, Jieliang Luo|arXiv (Cornell University)|Sep 23, 2018
Reinforcement Learning in Robotics参考文献 13被引用 4
一句话总结

本文提出了一种混合学习框架,将基于模型的轨迹优化与演员-评论家强化学习相结合,以实现高精度工业装配。通过使用最优轨迹作为半监督信号,并利用评论家网络稳定策略学习,该方法在收敛速度和鲁棒性方面优于纯强化学习,减少了数据需求,并在高刚性系统中的力/扭矩反馈环境中提升了稳定性。

ABSTRACT

Automatic assembly has broad applications in industries. Traditional assembly tasks utilize predefined trajectories or tuned force control parameters, which make the automatic assembly time-consuming, difficult to generalize, and not robust to uncertainties. In this paper, we propose a learning framework for high precision industrial assembly. The framework combines both the supervised learning and the reinforcement learning. The supervised learning utilizes trajectory optimization to provide the initial guidance to the policy, while the reinforcement learning utilizes actor-critic algorithm to establish the evaluation system even the supervisor is not accurate. The proposed learning framework is more efficient compared with the reinforcement learning and achieves better stability performance than the supervised learning. The effectiveness of the method is verified by both the simulation and experiment.

研究动机与目标

  • 解决传统装配方法依赖人工轨迹调优且对环境不确定性敏感的局限性。
  • 改善涉及力/扭矩反馈和刚性机器人动力学的高精度装配任务中的数据效率与训练稳定性。
  • 开发一种结合基于模型优化与无模型强化学习优势的学习框架,以实现更优的性能与可靠性。
  • 实现在销孔插入等任务中,针对孔位、形状和间隙变化的鲁棒泛化能力。

提出的方法

  • 该框架利用包含位置和力/扭矩反馈的轨迹优化作为半监督信号,生成初始最优轨迹。
  • 采用演员-评论家网络,结合最优轨迹的监督学习与评论家网络提供的策略梯度更新进行训练。
  • 评论家网络基于半监督信号输出与实时策略探索结果学习Q值,为策略质量提供稳定的真实标签评估。
  • 演员网络通过监督指导与策略梯度信号的结合进行更新,提升收敛性与稳定性。
  • 采用混合训练策略,减少对随机探索的依赖,缩小探索空间,提升数据效率。
  • 该方法集成低层级跟踪控制器,执行由策略生成的速度指令,确保末端执行器运动的精确性。

实验结果

研究问题

  • RQ1结合基于模型优化与演员-评论家强化学习的混合学习框架,能否在高精度装配任务中提升数据效率与训练稳定性?
  • RQ2评论家网络的引入在轨迹优化中如何缓解由刚性机器人动力学与力/扭矩反馈引起的不稳定性?
  • RQ3所学策略在孔位、形状与间隙变化下的泛化能力达到何种程度?
  • RQ4在仿真与真实世界实验中,该框架相较于纯DDPG、TD3与SAC在样本效率与收敛速度方面表现如何?

主要发现

  • 在乐高砖块插入任务中,guided-DDPG框架在800次rollouts内成功完成任务,而纯DDPG需要5,000次rollouts且表现不一致。
  • 所提方法将训练时间从83分钟(DDPG)减少至37.3分钟,rollouts从7,000次减少至1,500次,显著提升了数据与时间效率。
  • 该策略成功实现了在孔位存在0.5 mm不确定性、最大偏移5 mm,以及多种形状(如4×2砖块与带不完整孔的圆柱体)下的插入。
  • 该策略在间隙变化中表现出良好泛化能力,成功插入0.1 mm、1 μm与0 μm间隙的孔中,证明了对几何不确定性的鲁棒性。
  • 实验中,guided-DDPG在1.5小时内于3 mm探索半径内找到策略,而纯DDPG需2小时在1 mm半径内找到策略,表明其探索范围更广且效率更高。
  • 评论家网络通过校正轨迹优化器的不准确性,有效稳定了训练过程,防止策略崩溃,提升了可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。