[论文解读] Transferable Force-Torque Dynamics Model for Peg-in-hole Task
本文提出了一种可迁移的力矩-力动力学模型,用于插销装配任务,采用多姿态力矩-力状态表示和离线数据生成,实现了样本高效的训练并能快速适应未见过的销孔几何形状。该模型在仅使用2%训练数据进行微调的情况下,结合模型预测控制(MPC)和基于模型的强化学习(RL),实现了超过80%的插入成功率,展现出强大的泛化能力和样本效率。
We present a learning-based force-torque dynamics to achieve model-based control for contact-rich peg-in-hole task using force-only inputs. Learning the force-torque dynamics is challenging because of the ambiguity of the low-dimensional 6-d force signal and the requirement of excessive training data. To tackle these problems, we propose a multi-pose force-torque state representation, based on which a dynamics model is learned with the data generated in a sample-efficient offline fashion. In addition, by training the dynamics model with peg-and-holes of various shapes, scales, and elasticities, the model could quickly transfer to new peg-and-holes after a small number of trials. Extensive experiments show that our dynamics model could adapt to unseen peg-and-holes with 70% fewer samples required compared to learning from scratch. Along with the learned dynamics, model predictive control and model-based reinforcement learning policies achieve over 80% insertion success rate. Our video is available at https://youtu.be/ZAqldpVZgm4.
研究动机与目标
- 为解决在真实世界数据有限的情况下,学习接触丰富的力矩-力动力学的挑战。
- 克服单个6D力矩-力信号在定位接触位置时的模糊性。
- 实现动力学模型对未见过的销孔配置(包括不同形状、尺度和弹性)的快速适应。
- 开发一种样本高效的训练流程,以减少对昂贵的在线真实机器人数据采集的依赖。
- 将学习到的动力学模型集成到基于模型的控制策略中,实现高精度插入。
提出的方法
- 引入一种多姿态力矩-力状态表示方法,即在每个接触位置从末端执行器的多个姿态采集力矩-力反馈,以消除接触位置的歧义。
- 提出一种新颖的离线数据生成方法,从少量网格采样的力矩-力测量值中合成大量轨迹,从而实现高效的监督训练。
- 在包含不同形状、尺度和弹性的销与孔的多样化数据集上训练动力学模型,以确保其可迁移性。
- 仅使用少量真实世界样本(例如,完整数据集的2%)对模型进行微调,以适应新的、未见过的销孔组合。
- 利用学习到的动力学模型,结合模型预测控制(MPC)和基于模型的强化学习(RL)来引导插入过程。
- 该方法仅依赖末端执行器的力矩-力反馈,避免对视觉或本体感觉的依赖。
实验结果
研究问题
- RQ1能否仅使用力输入训练出一个力矩-力动力学模型,以准确预测插销任务中的状态转移?
- RQ2如何解决6D力矩-力信号的模糊性,以实现在插入过程中可靠的接触定位?
- RQ3在仅进行少量微调的情况下,一个在多样化销孔配置上训练的动力学模型,能在多大程度上泛化到未见过的几何形状?
- RQ4离线数据生成是否能显著减少在学习力矩-力动力学过程中对在线真实机器人数据采集的需求?
- RQ5学习到的动力学模型是否能在成功率和样本效率方面提升控制策略的性能?
主要发现
- 当与模型预测控制或基于模型的强化学习结合时,该动力学模型实现了超过80%的插入成功率。
- 使用仅完整数据集2%(每孔1.6个样本)的微调数据,预训练的动力学模型预测误差低于0.1 N·m,表明其具有高精度。
- 与从零开始训练相比,该模型将所需样本数量减少了70%,展现出强大的样本效率。
- 仅使用20%的数据,微调后的动力学模型性能优于在100%数据上从零开始训练的模型。
- 使用微调后的动力学模型进行基于模型的强化学习,仅需16个真实世界样本即可实现超过90%的成功率,而在线策略学习则需要12,000个样本。
- 该模型成功迁移至未见过的销孔配置,包括直径为15 mm的硬质圆形孔,且仅需极少的微调。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。