Skip to main content
QUICK REVIEW

[论文解读] In-Hand Object Rotation via Rapid Motor Adaptation

Haozhi Qi, Ashish Kumar|arXiv (Cornell University)|Oct 10, 2022
Robot Manipulation and Learning被引用 13
一句话总结

本文提出了一种在仿真中训练、仅依赖本体感觉的控制器,使真实世界机械手能够在无需真实世界微调的情况下,旋转各种物体绕z轴。通过利用快速运动适应,从本体感觉历史中估计物体属性,该方法仅使用指尖反馈,即在30多种尺寸、质量与形状各异的物体上实现了稳健的泛化能力。

ABSTRACT

Generalized in-hand manipulation has long been an unsolved challenge of robotics. As a small step towards this grand goal, we demonstrate how to design and learn a simple adaptive controller to achieve in-hand object rotation using only fingertips. The controller is trained entirely in simulation on only cylindrical objects, which then - without any fine-tuning - can be directly deployed to a real robot hand to rotate dozens of objects with diverse sizes, shapes, and weights over the z-axis. This is achieved via rapid online adaptation of the controller to the object properties using only proprioception history. Furthermore, natural and stable finger gaits automatically emerge from training the control policy via reinforcement learning. Code and more videos are available at https://haozhi.io/hora

研究动机与目标

  • 在无需真实世界微调的情况下,实现对多样化真实世界物体的可泛化在手旋转。
  • 解决仅使用本体感觉反馈来操控具有未知物理属性(质量、尺寸、形状)物体的挑战。
  • 探究是否能从本体感觉历史中涌现出低维、可解释的物体属性表征,以实现快速适应。
  • 证明稳定、自然的指部步态可从强化学习中自发产生,而无需显式设计。
  • 验证仅依赖本体感觉的适应能力是否能实现对训练中未见物体的稳健泛化。

提出的方法

  • 在仿真环境中使用不同尺寸和质量的圆柱形物体训练强化学习策略。
  • 学习物体属性(外在参数)的压缩表征,以捕捉指尖感知到的质量、尺寸和形状。
  • 通过监督学习在仿真中训练快速运动适应模块,从本体感觉历史中估计外在参数向量。
  • 在真实世界部署期间,利用估计的外在参数在线调整控制策略。
  • 仅使用本体感觉反馈(关节位置和速度)实现实时适应,避免依赖视觉或触觉传感器。
  • 使用t-SNE可视化分析估计外在参数的结构,确认其与物理属性相关的低维、可解释聚类。

实验结果

研究问题

  • RQ1仅在圆柱形物体上训练的控制器,能否仅通过本体感觉泛化到多样化的真实世界物体?
  • RQ2对估计的物体属性(外在参数)进行快速在线适应,是否能实现对不同质量和形状物体的稳健在手旋转?
  • RQ3稳定、自然的指部步态能否从端到端的强化学习中自发产生,而无需显式设计步态?
  • RQ4估计的外在参数向量是否具有可解释性且结构清晰,从而支持对未见物体的泛化?
  • RQ5本体感觉历史在多大程度上可独立实现适应,而无需视觉或触觉反馈?

主要发现

  • 该控制器成功旋转了30多种真实世界物体,直径范围为4.5厘米至7.5厘米,质量范围为5克至200克,且未进行真实世界微调。
  • 在t-SNE空间中,估计的外在参数向量显示出清晰的聚类,不同尺寸和质量的物体具有明显区域,表明其具有低维、可解释的表征。
  • 外在参数向量的第二维与物体质量之间存在显著相关性,质量较轻的物体对应更高的数值。
  • 该方法实现了稳定、高抬升的指部步态,这些步态自然地从训练中涌现,而基于球形物体训练的策略则导致不稳定的步态。
  • 失败案例主要源于错误的接触点或手指与极小物体(直径 < 4.0厘米)发生碰撞,凸显了在缺乏接触反馈时抓握稳定性方面的局限性。
  • 该方法可泛化至非刚性及多孔物体,证明了其对材料和形状变化的鲁棒性,超越了训练分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。