[论文解读] Segmentation-driven 6D Object Pose Estimation
该论文提出了一种基于分割的6D物体位姿估计框架,通过预测局部物体部件的2D关键点位置和分割掩码,并利用RANSAC-based PnP融合置信度高的预测结果,从而提升对遮挡的鲁棒性。该方法在Occluded-LINEMOD和YCB-Video数据集上优于当前最先进方法,并通过联合学习分割与局部位姿估计实现了实时推理。
The most recent trend in estimating the 6D pose of rigid objects has been to train deep networks to either directly regress the pose from the image or to predict the 2D locations of 3D keypoints, from which the pose can be obtained using a PnP algorithm. In both cases, the object is treated as a global entity, and a single pose estimate is computed. As a consequence, the resulting techniques can be vulnerable to large occlusions. In this paper, we introduce a segmentation-driven 6D pose estimation framework where each visible part of the objects contributes a local pose prediction in the form of 2D keypoint locations. We then use a predicted measure of confidence to combine these pose candidates into a robust set of 3D-to-2D correspondences, from which a reliable pose estimate can be obtained. We outperform the state-of-the-art on the challenging Occluded-LINEMOD and YCB-Video datasets, which is evidence that our approach deals well with multiple poorly-textured objects occluding each other. Furthermore, it relies on a simple enough architecture to achieve real-time performance.
研究动机与目标
- 解决6D物体位姿估计中全局位姿估计在大范围遮挡和杂乱场景下的脆弱性问题。
- 通过利用局部部件级预测而非全局物体级推理,克服单一代位姿回归或关键点检测方法的局限性。
- 在端到端、支持实时推理的架构中,联合执行实例分割与6D位姿估计。
- 通过结合置信加权的局部位姿候选,提升在存在多个低纹理、遮挡物体场景下的鲁棒性。
- 消除以往基于深度学习的位姿估计方法中常见的后处理优化步骤。
提出的方法
- 使用双流卷积神经网络,共享编码器并为分割和2D关键点回归分别设置独立解码器。
- 在输入图像的S×S空间网格的每个网格位置上,预测2D关键点位置和物体部件的分割掩码。
- 为每个预测的2D关键点分配置信度分数,以评估局部预测的可靠性。
- 汇总所有可见物体部件中,每个3D关键点最可靠的2D投影,形成鲁棒的3D到2D对应关系。
- 应用基于RANSAC的PnP算法,从融合的对应关系中计算出单一、可靠的6D位姿估计。
- 使用结合分割交叉熵损失和关键点回归损失的多任务损失,端到端训练网络。
实验结果
研究问题
- RQ1与全局物体级位姿估计相比,局部部件级位姿预测是否能提升对遮挡的鲁棒性?
- RQ2在杂乱或遮挡场景中,使用置信度分数组合多个局部位姿候选对位姿精度有何影响?
- RQ3能否通过轻量化架构实现联合分割与位姿估计,并支持实时推理?
- RQ4在具有挑战性的遮挡数据集上,该方法相较于当前最先进全局回归和关键点检测方法的性能提升程度如何?
- RQ5局部预测的融合是否能消除6D位姿估计中对后处理优化步骤的需求?
主要发现
- 在YCB-Video数据集上,该方法优于PoseCNN和Heatmaps,实现了更高的平均6D位姿精度,且未使用特征映射。
- 在Occluded-LINEMOD基准上,该方法达到最先进性能,尤其在严重遮挡场景下表现突出。
- 该方法推理速度比PoseCNN和Heatmaps快五倍以上,可在标准硬件上实现实时推理。
- 定性结果表明,即使物体被严重遮挡,该方法仍能生成准确的位姿估计,而PoseCNN因受背景或邻近物体干扰而失效。
- 当适配为预测2D角点时,该方法优于全局方法如Mask R-CNN和CPM,证明了局部推理相比全局感受野的优势。
- 尽管结果表现强劲,但该方法仍逊于能为每个3D关键点选择最佳关键点预测的“理想”模型,表明在置信度评分与融合策略方面仍有改进空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。