[论文解读] GDN: A Coarse-To-Fine (C2F) Representation for End-To-End 6-DoF Grasp Detection
该论文提出GDN,一种基于新型粗到细(C2F)表示的一阶段端到端6-DoF抓取检测网络,能够从点云中实现快速、多样且准确的抓取预测。通过使用置信度网格进行粗略选择并结合残差微调,GDN在单物体场景中实现20倍的推理加速和8%的成功率提升,在杂乱场景中实现40%的完整率提升,优于当前最先进的一阶段两阶段方法。
We proposed an end-to-end grasp detection network, Grasp Detection Network (GDN), cooperated with a novel coarse-to-fine (C2F) grasp representation design to detect diverse and accurate 6-DoF grasps based on point clouds. Compared to previous two-stage approaches which sample and evaluate multiple grasp candidates, our architecture is at least 20 times faster. It is also 8% and 40% more accurate in terms of the success rate in single object scenes and the complete rate in clutter scenes, respectively. Our method shows superior results among settings with different number of views and input points. Moreover, we propose a new AP-based metric which considers both rotation and transition errors, making it a more comprehensive evaluation tool for grasp detection models.
研究动机与目标
- 解决两阶段6-DoF抓取检测的局限性,其速度慢且由于启发式标签选择而难以捕捉姿态多样性。
- 克服单阶段6-DoF抓取网络中的标签多样性问题,通常每个点仅使用一个真实标签抓取,导致泛化性能不佳。
- 设计一种新颖的粗到细(C2F)表示,实现在单次前向传播中为每个抓取点预测多个多样化的抓取姿态。
- 提升对稀疏点云和不同输入视角的鲁棒性,确保在不同传感条件下性能一致。
- 提出一种基于平均精度(AP)的新评估指标,综合考虑旋转和位移误差,实现更全面的模型评估。
提出的方法
- 采用基于PointNet++的主干网络将输入点云下采样为抓取点,作为潜在抓取预测的中心。
- 引入粗到细(C2F)表示:粗略部分定义为对量化抓取方向的置信度网格,细化部分使用残差偏移来微调选定的粗略姿态。
- 使用共享的多层感知机在每个抓取点上直接预测C2F表示,支持端到端训练和推理。
- 应用可微变换将C2F表示转换为最终的6-DoF抓取姿态(位置+方向)。
- 集成一种新的基于平均精度(AP)的评估指标,通过结合旋转误差和位移误差来评估抓取检测性能。
- 使用损失函数端到端训练模型,同时优化抓取质量与姿态准确性,监督对象为C2F表示。
实验结果
研究问题
- RQ1通过保留标签多样性,单阶段6-DoF抓取检测网络是否能在准确率和速度上超越两阶段基线方法?
- RQ2所提出的粗到细(C2F)表示在保持高推理效率的同时,对建模多样化抓取姿态的有效性如何?
- RQ3C2F表示在稀疏点云输入和不同输入视角数量下,对泛化能力和鲁棒性的提升程度如何?
- RQ4所提出的综合考虑旋转和位移误差的AP-based评估指标,是否能提供更可靠且与环境无关的抓取检测模型评估?
- RQ5在以往方法因姿态聚集和缺乏多样性而失效的复杂杂乱场景中,该模型是否能保持高性能?
主要发现
- 在单物体抓取场景中,GDN实现了95.6%的成功率,比次优基线PointNetGPD高出8%,在YCB数据集上表现优异。
- 在杂乱场景中,GDN实现了85.33%的完整率,比PointNetGPD高出40%,比GPD高出39%,展现出卓越的鲁棒性。
- GDN的推理速度比当前最先进的一阶段两阶段方法(GPD和PointNetGPD)快20倍以上,单样本推理时间仅为0.10秒,而GPD为3.32秒。
- 即使在稀疏点云条件下,GDN仍保持高性能,当输入点数减少至256时,$AP_H$仅下降7.6%,优于S4G和PointNetGPD(性能下降超过50%)。
- t-SNE可视化结果表明,GDN的预测覆盖了真实抓取姿态的完整分布,具有高度多样性,而GPD和PointNetGPD的预测则呈现聚集、非多样化的分布。
- 消融实验表明,同时结合C2F表示与余弦滚转正则化可获得最高的$AP_H$(0.8380),证实了两个组件的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。