[论文解读] Real-world Multi-object, Multi-grasp Detection
本文提出了一种基于深度学习的方法,用于在RGB-D图像中实时、单次推理检测单个或多个物体的多个抓取候选。通过将抓取方向预测建模为带有一个无抓取(no-grasp)类别的分类问题,模型提升了鲁棒性和准确性,在Cornell数据集上实现了96.1%的物体级准确率,并在7-DOF机械臂的真实实验中实现了89.0%的抓取成功率,所有推理时间均在0.25秒以内。
A deep learning architecture is proposed to predict graspable locations for robotic manipulation. It considers situations where no, one, or multiple object(s) are seen. By defining the learning problem to be classification with null hypothesis competition instead of regression, the deep neural network with RGB-D image input predicts multiple grasp candidates for a single object or multiple objects, in a single shot. The method outperforms state-of-the-art approaches on the Cornell dataset with 96.0% and 96.1% accuracy on image-wise and object- wise splits, respectively. Evaluation on a multi-object dataset illustrates the generalization capability of the architecture. Grasping experiments achieve 96.0% grasp localization and 88.0% grasping success rates on a test set of household objects. The real-time process takes less than .25 s from image to plan.
研究动机与目标
- 解决在杂乱的真实场景中检测一个或多个物体的多个可行抓取配置的挑战。
- 通过用分类方法替代基于回归的抓取方向预测,并引入专门的“无抓取”类别以排除模糊区域,提升抓取检测的鲁棒性。
- 通过确保推理时间低于0.25秒的同时在多样化家用物体上保持高准确率,实现机器人操作的实时性。
- 在新收集的多物体、多抓取数据集上评估模型的泛化能力,该数据集包含真实标注。
提出的方法
- 模型使用ResNet-50主干网络并输入RGB-D数据以提取特征,将传统回归方法替换为分类方法进行抓取方向预测。
- 一个抓取区域建议网络识别潜在的抓取区域,随后通过分类头预测离散的抓取角度和一个“无抓取”类别,以抑制误报。
- 该架构将抓取建议分支与分类分支端到端集成,支持联合优化,从而提升多个抓取候选的定位能力。
- 该方法采用多任务学习设置,网络通过一次前向传播同时预测边界框参数和抓取方向类别。
- 通过将一个颜色通道替换为深度信息,实现RGB与深度信息的融合,在保持模型规模的同时提升性能。
- 系统输出多个带有置信度分数的抓取候选,便于下游规划模块选择最优抓取策略。
实验结果
研究问题
- RQ1深度学习模型是否能在单次前向传播中有效检测单个或多个物体的多个抓取候选?
- RQ2将抓取方向预测建模为带有一个空类别的分类问题,相比回归方法,如何提升检测准确率和鲁棒性?
- RQ3该模型在标准Cornell基准之外的真实世界多物体、多抓取场景中的表现如何?
- RQ4抓取建议与分类分支的集成如何改善定位精度并减少误报?
- RQ5该系统在7-DOF机械臂上的实时推理速度和物理抓取成功率是多少?
主要发现
- 在Cornell数据集上,该模型实现了96.0%的图像级准确率和96.1%的物体级准确率,优于当前最先进方法。
- 在新收集的多物体、多抓取数据集上,系统保持了优异性能,每张图像仅有1.0个误报,抓取漏检率较低。
- 在7-DOF机械臂上进行的物理抓取实验取得了89.0%的成功率,推理与规划耗时均低于0.25秒。
- 消融实验证实,引入抓取建议与方向分类显著提升了性能,完整模型(f)达到96.1%的物体级准确率。
- 仅使用RGB的模型版本仍表现良好(物体级准确率为88.1%),表明深度信息虽有益,但并非实现高性能的必要条件。
- 该系统在真实世界杂乱场景和多样化家用物体上表现出强大的泛化能力,使用预测抓取候选进行物理执行时性能仅下降8.3%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。