Skip to main content
QUICK REVIEW

[论文解读] Latent-Class Hough Forests for 6 DoF Object Pose Estimation

Rigas Kouskouridas, Alykhan Tejani|arXiv (Cornell University)|Feb 3, 2016
Advanced Neural Network Applications被引用 6
一句话总结

本文提出了一种新颖的一类学习框架——潜在类霍夫随机森林(Latent-Class Hough Forests),用于在杂乱和遮挡场景中进行6自由度物体位姿估计。通过将尺度不变的模板描述子适配为带有基于模板的分裂函数的回归森林,并在测试时迭代推断潜在类分布,该方法在多实例数据集上实现了最先进性能,包括一个全新的全标注的料箱抓取基准数据集,实现了高精度检测与遮挡感知的分割。

ABSTRACT

In this paper we present Latent-Class Hough Forests, a method for object detection and 6 DoF pose estimation in heavily cluttered and occluded scenarios. We adapt a state of the art template matching feature into a scale-invariant patch descriptor and integrate it into a regression forest using a novel template-based split function. We train with positive samples only and we treat class distributions at the leaf nodes as latent variables. During testing we infer by iteratively updating these distributions, providing accurate estimation of background clutter and foreground occlusions and, thus, better detection rate. Furthermore, as a by-product, our Latent-Class Hough Forests can provide accurate occlusion aware segmentation masks, even in the multi-instance scenario. In addition to an existing public dataset, which contains only single-instance sequences with large amounts of clutter, we have collected two, more challenging, datasets for multiple-instance detection containing heavy 2D and 3D clutter as well as foreground occlusions. We provide extensive experiments on the various parameters of the framework such as patch size, number of trees and number of iterations to infer class distributions at test time. We also evaluate the Latent-Class Hough Forests on all datasets where we outperform state of the art methods.

研究动机与目标

  • 解决在存在多个物体实例的复杂杂乱与遮挡场景中进行6自由度物体位姿估计的挑战,尤其在真实世界条件下。
  • 通过实现仅使用正样本的一类训练,避免负样本,克服传统霍夫随机森林与回归森林的局限,降低训练复杂度。
  • 通过在推理过程中将叶节点的类分布建模为潜在变量,提升对背景杂乱与前景遮挡的鲁棒性。
  • 作为副产品,提供精确的像素级遮挡感知分割掩码,支持场景理解与ICP优化等应用。
  • 开发并发布两个新的、具有挑战性的公开数据集——家用环境数据集与料箱抓取数据集,涵盖多实例场景,具有严重的2D与3D杂乱与遮挡。

提出的方法

  • 将LINEMOD模板匹配特征适配为尺度不变的图像块描述子,用于随机森林框架。
  • 提出一种新颖的基于模板的分裂函数,使仅使用正样本即可有效训练回归森林。
  • 仅使用正样本进行森林训练(一类学习),在推理过程中将叶节点的类分布视为潜在变量。
  • 在测试时执行迭代推理,更新潜在类分布(前景/背景/遮挡物),以优化霍夫投票图并减少杂乱引起的噪声。
  • 通过联合优化类概率的迭代细化,同时估计3D物体位姿与可见性图(遮挡感知分割掩码)。
  • 在霍夫随机森林框架内采用基于图像块与部件的策略,提升在部分遮挡与杂乱条件下的定位精度与鲁棒性。

实验结果

研究问题

  • RQ1在严重杂乱与遮挡条件下,霍夫随机森林中的一类学习方法是否能优于两类方法在6自由度位姿估计中的表现?
  • RQ2潜在类分布的迭代推理在多大程度上能提升位姿估计精度并减少杂乱场景中的误报?
  • RQ3带有潜在类建模的回归森林在多实例场景中,能否生成准确的遮挡感知分割掩码?
  • RQ4具有基于模板分裂函数的基于图像块的霍夫随机森林在具有严重遮挡的真实工业场景中是否具备良好的泛化能力?
  • RQ5在包含多实例、3D与2D杂乱的新颖挑战性数据集上,所提方法与现有最先进方法相比表现如何?

主要发现

  • 在料箱抓取数据集上,使用10棵树与2/3图像块尺寸时,该方法实现了90.8%的平均检测准确率与0.517的F1分数,优于Brachmann等人[5]的基线方法。
  • 使用10棵树与2/3图像块尺寸时,该方法在咖啡杯上的检测准确率为91.2%,F1分数为0.542;在果汁盒上的检测准确率为90.4%,F1分数为0.492。
  • 迭代推理过程显著改善了霍夫投票图与分割掩码,背景像素随迭代逐步被抑制。
  • 该系统在料箱抓取数据集上实现了接近实时的性能,无需GPU加速,展现出良好的实际可部署性。
  • 所提出的潜在类霍夫随机森林在所有评估数据集上均优于所有现有最先进方法,包括Hinterstoisser等人[16]的公开数据集。
  • 该方法作为副产品生成了精确的像素级遮挡感知分割掩码,支持后续任务如遮挡感知ICP与域自适应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。