Skip to main content
QUICK REVIEW

[论文解读] Single-Stage 6D Object Pose Estimation

Yinlin Hu, Pascal Fua|arXiv (Cornell University)|Nov 19, 2019
Robot Manipulation and Learning参考文献 56被引用 4
一句话总结

本文提出了一种单阶段6D物体位姿估计框架,通过设计一种能够处理对应关系组内排列不变性的深度网络,直接从3D到2D关键点对应关系回归6D位姿,同时保持关键点的顺序。通过用端到端可微的神经网络替代传统的基于RANSAC的PnP步骤,该方法在准确率和速度上均优于两阶段基线模型,在LINEMOD和YCB-Video基准测试中表现优于PoseCNN、SegDriven和PVNet等最先进模型。

ABSTRACT

Most recent 6D pose estimation frameworks first rely on a deep network to establish correspondences between 3D object keypoints and 2D image locations and then use a variant of a RANSAC-based Perspective-n-Point (PnP) algorithm. This two-stage process, however, is suboptimal: First, it is not end-to-end trainable. Second, training the deep network relies on a surrogate loss that does not directly reflect the final 6D pose estimation task. In this work, we introduce a deep architecture that directly regresses 6D poses from correspondences. It takes as input a group of candidate correspondences for each 3D keypoint and accounts for the fact that the order of the correspondences within each group is irrelevant, while the order of the groups, that is, of the 3D keypoints, is fixed. Our architecture is generic and can thus be exploited in conjunction with existing correspondence-extraction networks so as to yield single-stage 6D pose estimation frameworks. Our experiments demonstrate that these single-stage frameworks consistently outperform their two-stage counterparts in terms of both accuracy and speed.

研究动机与目标

  • 解决两阶段6D位姿估计流程中存在训练不充分及非端到端的问题,这些问题通常出现在深度对应预测后使用基于RANSAC的PnP步骤。
  • 消除对代理损失(如2D重投影误差)的依赖,这些损失并未直接优化最终位姿的准确性。
  • 开发一种可微、端到端可训练的架构,直接将3D到2D对应关系映射为6D位姿,从而提升准确率与推理速度。
  • 证明所提出的位姿回归网络与现有对应提取网络结合时的通用性与有效性。

提出的方法

  • 该方法引入一个深度神经网络,以候选的3D到2D对应关系组作为输入,每组对应一个3D关键点。
  • 网络显式建模每组对应关系内的排列不变性(即每组内对应关系的顺序不影响输出),同时保持对应于3D关键点序列的组间固定顺序。
  • 用可学习的、可微的模块替代传统的基于RANSAC的PnP算法,直接从对应关系回归6D位姿。
  • 该架构设计为通用结构,可无缝集成到任意最先进对应提取网络中,实现端到端训练。
  • 网络使用Adam优化器进行标准训练,结合数据增强和损失函数,最小化合成数据与真实数据上的3D和2D位姿误差(ADD与REP)。
  • 在LINEMOD和YCB-Video数据集上使用标准指标(ADD-0.1d与REP-5px)进行评估。

实验结果

研究问题

  • RQ1能否设计一种深度网络,以端到端可训练的方式直接从3D到2D对应关系回归6D位姿,从而绕过基于RANSAC的PnP步骤?
  • RQ2与两阶段框架相比,用可学习的、可微的模块替代RANSAC步骤是否能提升位姿估计的准确率与推理速度?
  • RQ3所提出的位姿回归网络能否在不同对应提取网络(如SegDriven和PVNet)上实现良好泛化?
  • RQ4在遮挡与杂波条件下,该单阶段框架在准确率与运行时间方面与最先进两阶段方法相比表现如何?

主要发现

  • 当与SegDriven或PVNet结合用于对应预测时,该单阶段框架在LINEMOD数据集上相较原始两阶段版本实现了稳定的准确率提升。
  • 在LINEMOD数据集上,与PVNet结合时,该方法实现了95.3%的ADD-0.1d和98.7%的REP-5px,优于两阶段PVNet基线模型。
  • 在YCB-Video数据集上,该方法实现了89.2%的ADD-0.1d和94.1%的REP-5px,在准确率与速度上均优于PoseCNN、SegDriven和PVNet。
  • 由于去除了迭代式的RANSAC步骤,该方法的推理速度接近PoseCNN的10倍,且几乎是SegDriven和PVNet的两倍。
  • 所提出的网络相比RANSAC表现出更好的重复性,因为它对输入对应关系的顺序不敏感,而原始PnP步骤则受顺序影响。
  • 尽管性能有所提升,但在给定极高精度对应关系时,学习到的位姿网络仍不如基于几何的传统PnP方法准确,表明在理想条件下仍存在性能差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。