Skip to main content
QUICK REVIEW

[论文解读] Probabilistic Category-Level Pose Estimation via Segmentation and Predicted-Shape Priors

Benjamin Burchfiel, George Konidaris|arXiv (Cornell University)|May 28, 2019
3D Shape Modeling and Analysis参考文献 16被引用 7
一句话总结

本文提出了一种结合混合密度网络(MDN)与形状先验及轮廓一致性约束的类别级3D姿态估计概率方法,能够从单张深度图像中生成多模态姿态分布。通过利用预测的形状和分割结果,基于后验采样策略验证姿态估计,该方法在ShapeNet和Pix3D数据集上显著降低了大姿态误差(>15°)现象,相比当前最先进方法表现更优。

ABSTRACT

We introduce a new method for category-level pose estimation which produces a distribution over predicted poses by integrating 3D shape estimates from a generative object model with segmentation information. Given an input depth-image of an object, our variable-time method uses a mixture density network architecture to produce a multi-modal distribution over 3DOF poses; this distribution is then combined with a prior probability encouraging silhouette agreement between the observed input and predicted object pose. Our approach significantly outperforms the current state-of-the-art in category-level 3DOF pose estimation---which outputs a point estimate and does not explicitly incorporate shape and segmentation information---as measured on the Pix3D and ShapeNet datasets.

研究动机与目标

  • 解决在无真实3D模型可用的情况下,对新物体进行类别级3D姿态估计的挑战。
  • 通过引入形状与分割一致性约束,提升对现有方法中常见大姿态误差(>15°)的鲁棒性。
  • 开发一种可变时间推理方法,动态提升姿态估计精度,随计算资源增加而优化。
  • 将生成式3D形状模型(HBEOs)与概率姿态预测相结合,实现多模态姿态估计。
  • 证明密度预测与姿态一致性先验对性能提升至关重要,优于点估计基线方法。

提出的方法

  • 扩展HBEOs生成模型,采用混合密度网络(MDN)架构,输出3DOF姿态的多模态分布。
  • 使用2D姿态一致性评分,评估由3D形状与姿态投影得到的预测物体轮廓与输入深度图像轮廓之间的一致性。
  • 基于轮廓一致性构建先验概率,以指导最大后验概率(MAP)姿态估计。
  • 采用基于采样的近似方法实现MAP估计,支持可变时间推理,更多采样可提升精度。
  • 利用生成模型从潜在表征重建3D形状的能力,验证姿态预测结果。
  • 将基于MDN的密度估计与后验推理步骤相结合,根据轮廓一致性对姿态候选进行加权。

实验结果

研究问题

  • RQ1概率性多模态姿态分布是否能显著优于点估计基线方法,提升类别级3D姿态估计性能?
  • RQ2基于轮廓的一致性先验在减少新物体姿态估计中的大姿态误差(>15°)方面效果如何?
  • RQ3基于MDN的密度预测与形状-轮廓一致性先验对性能提升的贡献程度分别有多大?
  • RQ4能否实现可变时间推理,使方法在增加推理时间或计算资源时精度得以提升?
  • RQ5在Pix3D和ShapeNet等标准基准上,该方法与基于RGB和基于深度的最先进方法相比表现如何?

主要发现

  • HBEO-MDN-Posterior在Pix3D数据集上表现最佳,优于所有基线方法,尤其在细粒度离散化水平(如24个方位角分区)下优势显著。
  • 与先前最先进方法相比,该方法显著降低了大姿态误差(>15°),在Pix3D椅子子集上误差率相对降低了15%。
  • 消融实验表明,基于MDN的密度预测与轮廓一致性先验均不可或缺,任一缺失均导致性能显著下降。
  • HBEO-MDN-Posterior在Pix3D数据集上实现了97%的90°-bin方位角任务准确率与93%的90°-bin仰角任务准确率,优于HBEOs及其他方法。
  • 该方法足够快速,适用于机器人应用,每秒可生成多个姿态估计结果,且随时间预算增加而精度持续提升。
  • 基于形状误差的基线方法(Sample + SDF Error)表现甚至劣于随机选择,表明仅依赖形状误差难以有效引导姿态估计。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。