Skip to main content
QUICK REVIEW

[论文解读] Generating Grasp Poses for a High-DOF Gripper Using Neural Networks

Min Liu, Zherong Pan|arXiv (Cornell University)|Mar 1, 2019
Robot Manipulation and Learning参考文献 35被引用 7
一句话总结

本论文提出一种基于深度学习的神经网络方法,用于生成高自由度(DOF)抓握姿态,通过一致性损失解决姿态歧义问题,并通过碰撞损失实现避碰。该方法在包含324种物体的大型增强数据集上进行训练,抓握姿态精度比监督基线方法高出4倍,并可在25自由度的Shadow手硬件平台上实现实时抓握生成(每轮3–5秒),即使在多视角深度图像生成的噪声3D重建模型下也能保持稳定性能。

ABSTRACT

We present a learning-based method for representing grasp poses of a high-DOF hand using neural networks. Due to redundancy in such high-DOF grippers, there exists a large number of equally effective grasp poses for a given target object, making it difficult for the neural network to find consistent grasp poses. We resolve this ambiguity by generating an augmented dataset that covers many possible grasps for each target object and train our neural networks using a consistency loss function to identify a one-to-one mapping from objects to grasp poses. We further enhance the quality of neural-network-predicted grasp poses using a collision loss function to avoid penetrations. We use an object dataset that combines the BigBIRD Database, the KIT Database, the YCB Database, and the Grasp Dataset to show that our method can generate high-DOF grasp poses with higher accuracy than supervised learning baselines. The quality of the grasp poses is on par with the groundtruth poses in the dataset. In addition, our method is robust and can handle noisy object models such as those constructed from multi-view depth images, allowing our method to be implemented on a 25-DOF Shadow Hand hardware platform.

研究动机与目标

  • 实现对复杂机械手的直接、快速且高精度的高自由度抓握姿态生成,无需低自由度假设。
  • 解决抓握姿态冗余带来的歧义问题,即单个物体存在多种有效抓握姿态。
  • 在处理多视角深度图像生成的噪声或不完整3D物体重建时,提升模型的泛化能力与鲁棒性。
  • 确保生成的抓握姿态无碰撞且在真实机器人操作中具备物理可行性。
  • 在25自由度Shadow手硬件平台上实现推理速度达到实时(每轮抓握3–5秒)。

提出的方法

  • 该方法使用神经网络将物体输入映射为单一抓握姿态,通过一致性损失函数,从大量候选姿态中选择一个代表性姿态,以解决歧义问题。
  • 引入一致性损失函数,引导网络学习在多种等效但多样的抓握配置下保持稳定且一致的抓握姿态表征。
  • 在训练过程中应用碰撞损失函数,对机械手与物体之间的穿透行为进行惩罚,确保生成的姿态具有物理可行性并避免自碰撞。
  • 训练数据集结合了BigBIRD、KIT、YCB和Grasp Datasets,每种物体包含数十个抓握姿态,以增强模型的鲁棒性与泛化能力。
  • 对于噪声输入模型,方法通过迭代旋转物体(3–5次)并重新运行推理,基于 wrench-space 指标选择质量最高的抓握姿态。
  • 最终抓握姿态通过 epsilon 指标在多个推理结果中选择,用于评估 wrench 空间中的抓握质量。

实验结果

研究问题

  • RQ1是否可以训练神经网络,使其在存在大量等效有效抓握配置的情况下,仍能稳定预测每个物体的单一高自由度抓握姿态?
  • RQ2如何使深度学习模型在面对多视角深度图像生成的噪声3D物体重建时仍保持高抓握精度与鲁棒性?
  • RQ3与标准监督学习相比,一致性损失与碰撞损失函数在多大程度上能提升预测抓握姿态的精度与可行性?
  • RQ4该方法是否能在25自由度机械手(如Shadow Hand)上实现低于5秒的实时推理(每轮抓握)并保持高成功率?
  • RQ5当应用于未见过的复杂物体时,该方法在抓握质量上与GraspIt!和监督学习基线方法相比表现如何?

主要发现

  • 与传统监督学习基线相比,该方法在抓握姿态预测精度(以与真实值的距离衡量)上提升了4倍。
  • 在15种通过多视角深度图像重建的真实物体上,抓握质量的平均 epsilon 指标达到0.102,证明了其对噪声输入的鲁棒性。
  • 该方法成功实现了在25自由度Shadow手上15次抓握中的12次成功,验证了其实际可用性与真实世界适用性。
  • 使用一致性损失与碰撞损失函数显著提升了姿态质量,并有效消除了穿透现象,即使在存在噪声或不完整物体模型的情况下也表现良好。
  • 与以往基于采样的方法需数百次旋转相比,该方法在推理阶段平均仅需3–5次物体旋转,显著提升了速度,实现了快速实时推理。
  • 该方法生成的抓握姿态在仿真与真实世界环境中,其质量与GraspIt!生成的结果相当,证实了其高保真度与可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。