Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning on Variable Impedance Controller for High-Precision Robotic Assembly

Jianlan Luo, Eugen Solowjow|arXiv (Cornell University)|Mar 4, 2019
Robot Manipulation and Learning参考文献 38被引用 20
一句话总结

本文提出了一种强化学习(RL)框架,将力/扭矩(F/T)反馈与操作空间控制器相结合,以实现高精度机器人装配。通过训练神经网络策略,利用F/T测量数据实现自适应阻抗控制,该方法在环境变化下表现出鲁棒的泛化能力,在成功率方面优于基线方法,并在高公差齿轮装配任务中展现出类人的基于力的插入策略。

ABSTRACT

Precise robotic manipulation skills are desirable in many industrial settings, reinforcement learning (RL) methods hold the promise of acquiring these skills autonomously. In this paper, we explicitly consider incorporating operational space force/torque information into reinforcement learning; this is motivated by humans heuristically mapping perceived forces to control actions, which results in completing high-precision tasks in a fairly easy manner. Our approach combines RL with force/torque information by incorporating a proper operational space force controller; where we also exploit different ablations on processing this information. Moreover, we propose a neural network architecture that generalizes to reasonable variations of the environment. We evaluate our method on the open-source Siemens Robot Learning Challenge, which requires precise and delicate force-controlled behavior to assemble a tight-fit gear wheel set.

研究动机与目标

  • 解决在高精度装配任务中(例如公差小于0.1 mm)传统控制器失效的挑战。
  • 探究在接触丰富的操作任务中,集成操作空间力/扭矩反馈是否能提升样本效率和策略性能。
  • 设计一种神经网络架构,通过在决策过程中显式使用F/T传感器数据,实现对局部环境变化的泛化能力。
  • 证明强化学习能够自主学习自适应柔顺行为,而无需依赖启发式力控制规则。
  • 在基座位置偏移等扰动下评估泛化能力,以模拟现实世界中的不确定性。

提出的方法

  • 采用迭代线性二次高斯(iLQG)控制器作为局部轨迹优化器,生成高质量的示范数据用于策略预训练。
  • 设计一种神经网络策略,以机器人状态和F/T传感器读数作为输入,其中F/T数据通过专用的特征提取头进行处理,以避免分布错位。
  • 使用引导式策略学习(GPS)将iLQG策略蒸馏为全局、端到端可微的神经网络策略。
  • 集成由操作空间动力学推导出的Pfaffian约束,以在策略的动作空间中嵌入物理一致性。
  • 使用稀疏密集奖励塑造方法训练策略,仅在任务正确完成后才发出成功信号。
  • 应用领域随机化和扰动测试,以评估在基座位置偏移下的鲁棒性和泛化能力。

实验结果

研究问题

  • RQ1在高精度机器人装配任务中,结合力/扭矩反馈的操作空间控制是否能提升样本效率和策略性能?
  • RQ2强化学习能否在无需手工设计启发式规则的情况下,自主学习自适应阻抗行为以实现柔顺插入?
  • RQ3显式处理F/T传感器数据是否能实现对局部环境变化(如基座位置偏移)的泛化?
  • RQ4在扰动下,所提出的神经网络架构与直接输入F/T数据或iLQG基线相比,在鲁棒性和成功率方面表现如何?
  • RQ5所学策略是否能在未见过的配置下保持高精度性能并实现泛化?

主要发现

  • 当基座发生1 cm位移时,该方法在10次试验中取得了90%的成功率(9/10),优于iLQG基线(80%)和F/T首层输入基线(0%)。
  • 在2 cm基座位移下,该方法成功率达到80%(8/10),而iLQG为50%,F/T首层输入基线为0%。
  • 在5 cm位移下,该方法维持了60%的成功率(6/10),而iLQG虽也达到60%但方差更高,F/T首层输入基线则完全失败。
  • 直接将F/T数据输入神经网络的第一层导致训练不稳定(KL散度较大)且行为表现差,包括随机运动,验证了结构化F/T特征处理的必要性。
  • 所学策略自主发现了类人的基于力的插入模式,F/T测量结果在接触阶段显示出特征性的力和扭矩峰值。
  • 在扰动下,神经网络策略的泛化能力优于iLQG,表明主动利用F/T信息可实现超越仅基于目标的LQR或iLQG所能达到的鲁棒适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。