Skip to main content
QUICK REVIEW

[论文解读] Multi-Fingered Active Grasp Learning

Qingkai Lu, Mark Van der Merwe|arXiv (Cornell University)|Jun 6, 2020
Robot Manipulation and Learning参考文献 44被引用 5
一句话总结

该论文提出了一种新颖的主动深度学习框架,用于多指机器人抓握,通过多臂赌博机公式联合优化抓握配置空间探索与分类器置信度。通过将学习得到的神经似然函数嵌入概率抓握规划,并集成到主动学习循环中,该方法在显著减少训练样本数量的同时,实现了与被动监督学习相当的抓握成功率,且在不同物体形状和纹理下生成了更多样化的抓握策略。

ABSTRACT

Learning-based approaches to grasp planning are preferred over analytical methods due to their ability to better generalize to new, partially observed objects. However, data collection remains one of the biggest bottlenecks for grasp learning methods, particularly for multi-fingered hands. The relatively high dimensional configuration space of the hands coupled with the diversity of objects common in daily life requires a significant number of samples to produce robust and confident grasp success classifiers. In this paper, we present the first active deep learning approach to grasping that searches over the grasp configuration space and classifier confidence in a unified manner. We base our approach on recent success in planning multi-fingered grasps as probabilistic inference with a learned neural network likelihood function. We embed this within a multi-armed bandit formulation of sample selection. We show that our active grasp learning approach uses fewer training samples to produce grasp success rates comparable with the passive supervised learning method trained with grasping data generated by an analytical planner. We additionally show that grasps generated by the active learner have greater qualitative and quantitative diversity in shape.

研究动机与目标

  • 为解决多指机器人抓握中因高维配置空间和物体多样性导致的高数据采集瓶颈问题。
  • 克服被动监督学习的局限性,后者因依赖解析规划器进行数据采集,导致生成的抓握策略存在偏差且多样性低。
  • 开发一种主动学习框架,动态选择信息量丰富的抓握配置,以减少样本数量并提升泛化能力。
  • 通过交互式假设检验,使抓握模型能够覆盖更广泛的可行配置空间和物体类型。
  • 证明主动学习可在显著减少训练数据量的情况下,达到或超越被动学习的性能。

提出的方法

  • 将主动抓握学习形式化为多臂赌博机问题,将三种不同的探索策略(如高不确定性、高置信度、多样化)视为不同臂。
  • 通过神经似然函数实现概率抓握规划,从主动模型生成高质量的抓握假设。
  • 集成一个学习得到的神经网络以估计抓握成功概率,实现对抓握配置的端到端可微分推理。
  • 采用基于赌博机的选择策略,选择最具有信息量的抓握配置进行下一轮标注,平衡探索与利用。
  • 使用真实机器人交互作为Oracle:机器人执行抓握操作,并自动标注成功/失败结果,无需人工干预。
  • 采用多变量高斯混合模型(MDN)先验和体素化抓握表示,以建模抓握分布的多样性。

实验结果

研究问题

  • RQ1主动学习能否在保持或提升成功率的前提下,减少多指抓握学习所需的训练样本数量?
  • RQ2与被动监督学习相比,主动学习是否能在相同或更多数据量下产生更多样化的抓握配置?
  • RQ3主动学习框架能否更好地覆盖不同物体几何形状下的高维抓握配置空间?
  • RQ4与基于解析规划器数据训练的被动监督模型相比,主动学习抓握模型的性能如何?
  • RQ5主动学习在多大程度上提升了对新型、部分观测物体的泛化能力?

主要发现

  • 该主动抓握学习方法在8个真实世界测试物体上实现了50%的抓握成功率,与使用大量数据训练的被动监督模型(52.5%成功率)相当。
  • 对于侧向抓握,主动学习者的成功率达到了93.3%,优于被动模型的78.6%,表明在具有挑战性的抓握类型上表现更优。
  • 主动学习者生成了15次侧向抓握和25次顶部抓握,多样性高于被动模型(14次侧向抓握,26次顶部抓握)。
  • 微分熵分析显示,主动模型的熵值更高(配置:-16.3,位姿:-3.7,关节:-11.8),而被动大样本模型的熵值较低(配置:-18.6,位姿:-4.2,关节:-13.5),表明主动模型具有更高的抓握多样性。
  • 主动学习方法在保持性能的同时减少了数据需求,证明主动采样比被动数据采集更能有效探索抓握配置空间。
  • 所有方法的顶部抓握性能均较低(主动:24%,被动大样本:34.5%),表明此类配置下仍需改进反馈控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。