Skip to main content
QUICK REVIEW

[论文解读] Global Hypothesis Generation for 6D Object Pose Estimation

Frank Michel, Alexander Kirillov|arXiv (Cornell University)|Dec 7, 2016
Robotics and Sensor-Based Localization参考文献 23被引用 6
一句话总结

本文提出一种基于全连接条件随机场(CRF)的全局假设生成方法,用于6D物体位姿估计,通过利用所有图像像素间的几何一致性,生成数量少但质量高的位姿假设集合。与依赖局部推理(如RANSAC或霍夫投票)的先前方法不同,该方法采用新颖的两步优化算法处理非高斯CRF势函数,在具有挑战性的“遮挡物体数据集”上实现最先进性能,平均准确率达到76.7%,较之前方法提升0.4%。

ABSTRACT

This paper addresses the task of estimating the 6D pose of a known 3D object from a single RGB-D image. Most modern approaches solve this task in three steps: i) Compute local features; ii) Generate a pool of pose-hypotheses; iii) Select and refine a pose from the pool. This work focuses on the second step. While all existing approaches generate the hypotheses pool via local reasoning, e.g. RANSAC or Hough-voting, we are the first to show that global reasoning is beneficial at this stage. In particular, we formulate a novel fully-connected Conditional Random Field (CRF) that outputs a very small number of pose-hypotheses. Despite the potential functions of the CRF being non-Gaussian, we give a new and efficient two-step optimization procedure, with some guarantees for optimality. We utilize our global hypotheses generation procedure to produce results that exceed state-of-the-art for the challenging "Occluded Object Dataset".

研究动机与目标

  • 通过用全局几何一致性检查替代局部假设生成,提升6D物体位姿估计性能。
  • 解决现有方法依赖局部推理(如RANSAC、霍夫投票)进行位姿假设生成的局限性。
  • 为具有非高斯势函数的全连接CRF开发高效的优化流程,实现在位姿估计流程中的全局推理。
  • 证明在假设生成阶段采用全局推理可显著提升在高度遮挡场景下的性能表现。
  • 通过最小化假设数量并最大化其质量,在‘遮挡物体数据集’上实现最先进准确率。

提出的方法

  • 使用随机森林预测RGB-D图像中每个像素的密集3D物体坐标(部件标签)。
  • 构建全连接CRF以建模所有像素之间的成对几何一致性,识别与位姿一致的区域。
  • CRF的非高斯势函数编码3D物体坐标与其在2D图像中的投影之间的几何约束。
  • 提出一种新颖的两步优化流程,高效求解CRF,并提供最优性理论保证。
  • 通过类似ICP的精化步骤,从与位姿一致的像素中估计最终位姿。
  • 在‘遮挡物体数据集’上进行训练与评估,采用标准的10%物体直径阈值作为位姿准确率判定标准。

实验结果

研究问题

  • RQ1在假设生成阶段采用全局几何推理是否能优于局部推理方法在6D物体位姿估计中的表现?
  • RQ2是否可行使用具有非高斯势函数的全连接CRF,实现高效且准确的6D位姿假设生成?
  • RQ3尽管每个假设的计算成本增加,通过全局一致性检查减少假设数量是否仍能提升最终位姿准确率?
  • RQ4所提方法在高度遮挡场景下与最先进方法相比表现如何?
  • RQ5两步优化流程是否能在该场景下同时提供效率与最优性保证,适用于非高斯CRF?

主要发现

  • 所提方法在‘遮挡物体数据集’上实现76.7%的平均准确率,较之前最先进方法提升0.4%。
  • 该方法平均仅生成0–10个位姿假设,显著少于竞争方法(如210–20,000个),同时保持高准确率。
  • 在八个物体中的四个(Ape、Driller、Eggbox、Hole Puncher)中,该方法在所有对比方法中达到最高准确率。
  • 与Brachmann等人[3]相比提升20.1%,与Krull等人[18]相比提升6.4%,证明全局推理相比局部三元组采样具有显著优势。
  • 尽管全连接CRF结构复杂,但通过高效优化,实现具有竞争力的运行时间(1–3秒)。
  • 定性结果表明,该方法在高度遮挡场景中能正确估计位姿,而先前方法在此类场景中失败,如图5所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。