[论文解读] GraspNet: A Large-Scale Clustered and Densely Annotated Dataset for Object Grasping
本文提出了GraspNet,一个大规模、真实世界RGB-D数据集,包含来自170个聚类场景的87,040张图像中超过3.7亿个密集标注的抓取姿态。通过结合真实传感器数据与基于分析计算的自动抓取姿态生成方法,并采用基于力闭合度量的统一评估系统,作者展示了该数据集与真实机器人抓取性能之间具有极强的一致性,高分抓取预测的成功率最高可达98%。
Object grasping is critical for many applications, which is also a challenging computer vision problem. However, for the clustered scene, current researches suffer from the problems of insufficient training data and the lacking of evaluation benchmarks. In this work, we contribute a large-scale grasp pose detection dataset with a unified evaluation system. Our dataset contains 87,040 RGBD images with over 370 million grasp poses. Meanwhile, our evaluation system directly reports whether a grasping is successful or not by analytic computation, which is able to evaluate any kind of grasp poses without exhausted labeling pose ground-truth. We conduct extensive experiments to show that our dataset and evaluation system can align well with real-world experiments. Our dataset, source code and models will be made publicly available.
研究动机与目标
- 为解决在杂乱场景中物体抓取任务缺乏大规模、密集标注且与真实世界对齐的数据集的问题。
- 克服人工标注数据集(规模小、标注稀疏)和仿真数据集(领域差距)的局限性。
- 开发一种统一的评估系统,无需预先标注的真实抓取姿态,通过分析计算实现对抓取成功性的直接评估。
- 建立一个与真实机器人性能高度一致的基准,适用于2D矩形和6D姿态基抓取检测方法。
- 提供公开可获取的数据集、代码和模型,以加速机器人抓取领域的研究。
提出的方法
- 使用物理传感器(如Intel RealSense 435)从170个聚类场景中采集真实世界的RGB-D图像,确保视觉真实感与多样性。
- 通过ArUco标记进行6D物体位姿估计,将物体坐标投影到场景坐标中,实现抓取姿态的精确定位。
- 在仿真中通过分析计算生成密集抓取姿态:针对每个物体,基于几何约束在三维空间中计算所有可行的抓取姿态。
- 定义基于元组的抓取距离度量,采用平移(1 cm)和旋转(5°)阈值,以处理NMS和评估中非均匀度量空间的问题。
- 实现统一的评估系统,通过力闭合度量计算抓取质量,无需预先标注的真实抓取姿态,从而支持对任意抓取姿态表示的评估。
- 在每类物体上应用NMS,选取置信度最高的前K(K=10)个抓取姿态,并使用阈值化距离度量合并冗余预测。
实验结果
研究问题
- RQ1是否能够高效构建一个大规模、真实世界数据集,并实现密集抓取标注,而无需依赖耗时的人工标注?
- RQ2基于分析计算的仿真标注流程与真实世界机器人抓取性能的对齐程度如何?
- RQ3基于力闭合度量的统一评估系统在多大程度上优于传统需要预先标注真实抓取姿态的方法?
- RQ4所提出的数据集与评估框架是否能够以一致且可比较的方式支持2D矩形和6D姿态基抓取检测方法?
- RQ5在该基准上,抓取检测模型的性能排名是否与真实世界机器人抓取成功率高度相关?
主要发现
- 该数据集包含87,040张真实世界的RGB-D图像和超过3.7亿个密集抓取姿态标注,其规模比以往数据集大三个数量级。
- 置信度得分为1.0的抓取预测在真实世界中平均成功率达到96%,表明其与物理抓取性能具有极强的一致性。
- 置信度得分为0.1的抓取预测成功率低于20%(例如Peeler和Dragon分别为9%),证实置信度得分与真实可行性密切相关。
- 基于力闭合度量的评估系统无需预先标注真实抓取姿态,即可成功识别高质量抓取,实现了通用且可扩展的基准测试。
- 机器人实验结果证实,分析式标注流程生成的抓取姿态对真实世界成功率具有高度预测能力,验证了数据集的真实感与实用性。
- 统一的评估系统使得不同抓取表示格式(如矩形与6D姿态)之间的比较保持一致,且无需针对特定度量进行重新训练或标注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。