Skip to main content
QUICK REVIEW

[论文解读] Jacquard: A Large Scale Dataset for Robotic Grasp Detection

Amaury Depierre, Emmanuel Dellandréa|arXiv (Cornell University)|Mar 30, 2018
Robot Manipulation and Learning参考文献 15被引用 18
一句话总结

本文介绍了 Jacquard,一个大规模的合成 RGB-D 数据集,包含超过一百万个通过物理仿真在逼真环境中生成的标注抓取位置。在 Jacquard 上训练的深度神经网络,其泛化能力和真实世界抓取成功率(78.43%)显著优于在较小的人工标注数据集(如 Cornell)上训练的模型,证明了合成数据在机器人抓取检测中的有效性。

ABSTRACT

Grasping skill is a major ability that a wide number of real-life applications require for robotisation. State-of-the-art robotic grasping methods perform prediction of object grasp locations based on deep neural networks. However, such networks require huge amount of labeled data for training making this approach often impracticable in robotics. In this paper, we propose a method to generate a large scale synthetic dataset with ground truth, which we refer to as the Jacquard grasping dataset. Jacquard is built on a subset of ShapeNet, a large CAD models dataset, and contains both RGB-D images and annotations of successful grasping positions based on grasp attempts performed in a simulated environment. We carried out experiments using an off-the-shelf CNN, with three different evaluation metrics, including real grasping robot trials. The results show that Jacquard enables much better generalization skills than a human labeled dataset thanks to its diversity of objects and grasping positions. For the purpose of reproducible research in robotics, we are releasing along with the Jacquard dataset a web interface for researchers to evaluate the successfulness of their grasping position detections using our dataset.

研究动机与目标

  • 解决机器人抓取检测中真实世界标注数据有限、昂贵且难以扩展的问题。
  • 克服人工标注数据集的局限性,后者耗时且在抓取位置和物体变化方面缺乏多样性。
  • 开发一种可扩展的自动化方法,利用物理仿真生成多样化、逼真且准确的抓取标注。
  • 通过合成数据增强,提升抓取检测模型在未见物体和复杂真实场景中的泛化能力。
  • 提供一个可复现的基准,配备网络界面和一种新型评估标准——模拟抓取试验(SGT),以超越几何距离评估抓取质量。

提出的方法

  • 使用 ShapeNet CAD 模型的一个子集生成合成数据集,通过变化的光照、纹理和相机角度渲染逼真的 RGB-D 图像。
  • 在物理引擎中模拟机器人抓取尝试,以确定有效的抓取位置,采用带有碰撞和稳定性检测的平行板夹爪模型。
  • 为每张图像标注二维抓取矩形(表示夹爪钳口),其位置和方向由成功的模拟抓取试验确定。
  • 引入模拟抓取试验(SGT)指标,基于模拟成功率评估抓取质量,而非仅依赖于与真实标注的几何距离。
  • 在 Jacquard 合成数据集和 Cornell 人工标注数据集上分别训练标准卷积神经网络(AlexNet),以实现直接比较。
  • 使用三种指标评估性能:基于矩形的 IoU、基于 SGT 的成功率,以及使用 Fanuc M-20iA 机械臂进行的真实世界机器人试验。

实验结果

研究问题

  • RQ1通过物理仿真生成的大规模合成数据集,是否能在将抓取检测泛化到未见物体方面,优于较小的人工标注数据集?
  • RQ2模拟抓取试验(SGT)指标与传统基于距离的指标相比,在评估抓取预测质量方面表现如何?
  • RQ3在合成数据上训练的深度神经网络,在多大程度上能实现与在真实、人工标注数据上训练的模型相当或更优的真实世界抓取成功率?
  • RQ4合成数据集中物体和抓取配置的多样性,是否能提升模型在新物体上的零样本泛化性能?
  • RQ5所提出的数据集和评估框架能否支持机器人抓取检测研究中的可复现和标准化基准测试?

主要发现

  • 在 Jacquard 数据集上训练的卷积神经网络,基于模拟抓取试验(SGT)标准,抓取成功率达到 72.42%,而同一网络在 Cornell 数据集上训练的抓取成功率仅为 42.76%。
  • 在真实世界机器人试验中,Jacquard 训练的模型实现了 78.43% 的抓取成功率,优于 Cornell 训练模型的 60.46%。
  • Jacquard 训练的模型在未见物体上表现出显著更好的泛化能力,当在 Cornell 上训练后测试全 Jacquard 数据集时,准确率仅为 54.28%,相比其基线性能下降了 20 个百分点。
  • SGT 指标显示,许多被 IoU 指标判定为错误的预测在视觉上是合理的,并且在模拟中经常成功,凸显了基于距离指标的局限性。
  • 在真实世界试验中,合成数据与人工标注数据训练的模型之间存在显著的性能差距,Jacquard 训练的模型在物理试验中成功率高出 17.97 个百分点。
  • 结果证实,包含多样化物体形状、材质和抓取配置的合成数据,能够实现比有限的人工标注数据更好的泛化能力,即使后者在标注精度上更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。