Skip to main content
QUICK REVIEW

[论文解读] Learning Generalizable Dexterous Manipulation from Human Grasp Affordance

Yueh-Hua Wu, Jiashun Wang|arXiv (Cornell University)|Apr 5, 2022
Robot Manipulation and Learning被引用 11
一句话总结

本文提出ILAD方法,利用人类抓握可及性模型生成大规模、多样化的示范数据,用于训练灵巧操作策略。通过结合一种新颖的模仿学习目标与基于PointNet的几何表征学习,该方法在仿真环境中对未见物体实现了强大的泛化能力,在新型物体重定位任务上显著优于基线方法。

ABSTRACT

Dexterous manipulation with a multi-finger hand is one of the most challenging problems in robotics. While recent progress in imitation learning has largely improved the sample efficiency compared to Reinforcement Learning, the learned policy can hardly generalize to manipulate novel objects, given limited expert demonstrations. In this paper, we propose to learn dexterous manipulation using large-scale demonstrations with diverse 3D objects in a category, which are generated from a human grasp affordance model. This generalizes the policy to novel object instances within the same category. To train the policy, we propose a novel imitation learning objective jointly with a geometric representation learning objective using our demonstrations. By experimenting with relocating diverse objects in simulation, we show that our approach outperforms baselines with a large margin when manipulating novel objects. We also ablate the importance on 3D object representation learning for manipulation. We include videos, code, and additional information on the project website - https://kristery.github.io/ILAD/ .

研究动机与目标

  • 解决灵巧操作策略在训练过程中未见过的物体实例上泛化能力不足的挑战。
  • 通过人类抓握可及性模型生成大规模、多样化的示范数据,克服模仿学习中人类示范数据规模小的局限性。
  • 通过联合优化技能学习与基于点云输入的3D几何表征学习,提升策略的泛化能力。
  • 通过新颖的模仿学习目标与表征微调,实现在仿真环境中对未见物体的高效且鲁棒的操作。
  • 证明类人抓握示范在提升新物体上策略成功率方面的有效性。

提出的方法

  • 利用人类抓握可及性模型预测同一类别中多样化3D物体的合理人手-物体交互,生成大规模灵巧操作示范。
  • 通过运动规划将预测的抓握姿态转换为完整的机器人轨迹示范,模拟类人抓握与伸展动作。
  • 使用新颖的模仿学习目标训练策略,基于策略置信度对示范进行排序,并动态加权高优势状态-动作对。
  • 联合优化策略与行为克隆目标,预训练并微调基于PointNet的物体点云几何表征。
  • 引入课程学习式训练策略,通过交互过程中收集的新数据更新策略,实现表征的持续优化。
  • 采用基于阈值的规划度量(δ)确保生成的示范接近目标抓握姿态,从而提升示范质量与策略性能。

实验结果

研究问题

  • RQ1基于人类抓握可及性模型生成的大规模、多样化示范是否能显著提升灵巧操作的泛化能力?
  • RQ2一种优先考虑低置信度示范的新型模仿学习目标,相比均匀加权,是否能更有效地提升策略泛化能力?
  • RQ3通过在示范数据上微调的PointNet进行几何表征学习,在未见物体上的零样本性能提升程度如何?
  • RQ4在示范生成中引入手部抓握姿态信息,对策略成功率与行为自然性有何影响?
  • RQ5示范质量与自然性对策略泛化到新物体实例的能力有何影响?

主要发现

  • ILAD在未见瓶子类物体上的成功率达到0.95 ± 0.03,显著优于次佳基线方法的0.71 ± 0.15。
  • 消融实验表明,若无手部抓握姿态信息,成功率为0.01 ± 0.01,凸显建模手-物体交互的重要性。
  • 当阈值δ = 0.06且包含抓握姿态信息时,该方法在未见瓶子上的成功率达到0.65 ± 0.24,证明了精确抓握规划的价值。
  • 通过Mechanical Turk进行的用户研究显示,71%的参与者认为生成的示范更自然,表明其类人程度更高。
  • 联合学习(JL)方法在所有类别中均取得最高成功率,证实了模仿学习与表征学习两者的协同增效作用。
  • 学习曲线显示,尽管所有方法在训练物体上的表现相近,但仅ILAD在未见物体上保持了强劲性能,证明其具备卓越的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。