[论文解读] Shape Completion Enabled Robotic Grasping
本文提出了一种基于3D卷积神经网络(CNN)的框架,通过单视角2.5D点云进行形状补全,实现机器人抓取规划。该方法在0.1秒内完成遮挡物体几何结构的补全,实现高精度抓取规划;在真实世界实验中实现了93.33%的抓取成功率,相比基线方法提升20%,与基于镜像的补全方法相比,关节误差降低18%。
This work provides an architecture to enable robotic grasp planning via shape completion. Shape completion is accomplished through the use of a 3D convolutional neural network (CNN). The network is trained on our own new open source dataset of over 440,000 3D exemplars captured from varying viewpoints. At runtime, a 2.5D pointcloud captured from a single point of view is fed into the CNN, which fills in the occluded regions of the scene, allowing grasps to be planned and executed on the completed object. Runtime shape completion is very rapid because most of the computational costs of shape completion are borne during offline training. We explore how the quality of completions vary based on several factors. These include whether or not the object being completed existed in the training data and how many object models were used to train the network. We also look at the ability of the network to generalize to novel objects allowing the system to complete previously unseen objects at runtime. Finally, experimentation is done both in simulation and on actual robotic hardware to explore the relationship between completion quality and the utility of the completed mesh model for grasping.
研究动机与目标
- 解决由于遮挡和不完整的3D感知导致的机器人抓取规划挑战。
- 通过深度学习实现从单视角快速、准确地完成3D物体形状补全。
- 通过从部分点云生成完整且高质量的网格重建,提升抓取规划性能。
- 开发一种可扩展、泛化能力强的框架,适用于真实机器人系统中新型和未见过的物体。
- 提供开源数据集和代码库,以支持形状补全在机器人领域研究的可复现性与未来发展。
提出的方法
- 在44万对由3D网格模型渲染的深度图像生成的40³体素网格对上训练3D CNN。
- 推理过程中,将单视角2.5D点云转换为占据网格,遮挡区域标记为空,输入已训练的CNN以预测完整占据网格。
- CNN输出通过移动立方体算法处理以生成网格;随后通过第二步CUDA加速后处理,整合观测点云中的精细细节,生成更高分辨率的抓取就绪网格。
- 系统从场景中分割出可抓取物体,分别处理每个物体,并通过快速补全非目标物体,支持在拥挤场景中的碰撞避免。
- 该框架在仿真环境和真实机器人硬件(使用Barrett机械手和Staubli TX60机械臂)上进行了评估。
- 训练在离线阶段完成,实现在推理阶段实时补全,平均补全时间低于0.1秒。
实验结果
研究问题
- RQ1基于深度学习的形状补全方法是否能显著提升相比启发式或对称补全方法的抓取成功率?
- RQ2形状补全质量在对象是否出现在训练数据集中,或训练所用模型数量不同时,有何变化?
- RQ3在推理阶段,CNN对新型、此前未见过的物体的泛化能力如何?
- RQ4形状补全质量与真实机器人系统中执行抓取的准确性和成功率之间是否存在相关性?
- RQ5系统能否高效完成拥挤场景中多个物体的补全?其是否能在规划中实现可靠的碰撞避免?
主要发现
- 所提方法在真实世界实验中实现了93.33%的抓取成功率,相比基线方法提升20%。
- 规划与执行抓取构型之间的平均关节误差为7.276°,相比基于镜像的方法(8.067°)降低了18%。
- CNN推理的平均补全时间低于0.1秒,后处理生成的网格约需2.4秒。
- 通过补全非目标物体,系统在规划中成功避免了碰撞,例如在某一场景中仅在应用形状补全后才成功规避了碰撞。
- 该方法对未见物体和视角具有良好的泛化能力,即使在训练数据中未出现的新物体,也能生成高质量补全结果。
- 已发布包含44万对体素网格对的开源数据集及配套代码库,以支持可复现性与未来研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。