Skip to main content
QUICK REVIEW

[论文解读] 3DP3: 3D Scene Perception via Probabilistic Programming

Nishad Gothoskar, Marco Cusumano-Towner|arXiv (Cornell University)|Oct 30, 2021
Robot Manipulation and Learning参考文献 40被引用 5
一句话总结

3DP3 提出了一种用于 3D 场景感知的概率编程框架,通过结构化生成建模,从 RGB-D 图像中联合推断 3D 物体形状、位姿以及层次化场景图。该方法通过结合自底向上的位姿提议、用于场景图结构的合内 MCMC 以及对不确定形状的伪边缘推断,在存在遮挡、接触和部分可观测性的现实世界场景中,实现了更优的 6DoF 物体位姿估计精度和更强的泛化能力,优于深度学习基线方法。

ABSTRACT

We present 3DP3, a framework for inverse graphics that uses inference in a structured generative model of objects, scenes, and images. 3DP3 uses (i) voxel models to represent the 3D shape of objects, (ii) hierarchical scene graphs to decompose scenes into objects and the contacts between them, and (iii) depth image likelihoods based on real-time graphics. Given an observed RGB-D image, 3DP3's inference algorithm infers the underlying latent 3D scene, including the object poses and a parsimonious joint parametrization of these poses, using fast bottom-up pose proposals, novel involutive MCMC updates of the scene graph structure, and, optionally, neural object detectors and pose estimators. We show that 3DP3 enables scene understanding that is aware of 3D shape, occlusion, and contact structure. Our results demonstrate that 3DP3 is more accurate at 6DoF object pose estimation from real images than deep learning baselines and shows better generalization to challenging scenes with novel viewpoints, contact, and partial observability.

研究动机与目标

  • 开发一种生成模型,以在部分可观测性、遮挡和复杂物体交互条件下实现鲁棒的 3D 场景理解。
  • 使用层次化场景图对 3D 场景进行建模,捕捉物体间的接触关系和位姿依赖性,且无需刚性结构假设。
  • 在真实世界和合成场景中,提升 6DoF 物体位姿估计的精度,超越深度学习基线方法。
  • 通过统一的概率框架,将基于模型的推理与数据驱动的检测器和位姿估计器相结合。
  • 在贝叶斯框架下,利用结构和几何先验,实现对完全遮挡物体的推断。

提出的方法

  • 使用基于体素的概率模型表示 3D 物体形状,并考虑因自遮挡带来的不确定性。
  • 采用层次化场景图对物体关系进行建模,包括平面接触关系,并使用灵活的结构先验。
  • 应用基于实时图形的深度图像似然函数,从 3D 场景假设中模拟观测到的 RGB-D 图像。
  • 实现一种新颖的合内 MCMC 核心,以在推断过程中高效探索场景图结构。
  • 将数据驱动的 Metropolis-Hastings 核用于物体位姿更新,并结合对不确定物体形状的伪边缘推断。
  • 将预训练的神经网络检测器和位姿估计器作为生成模型中的似然组件进行集成。

实验结果

研究问题

  • RQ1具有层次化场景图的结构化生成模型是否能提升在遮挡和接触条件下的 3D 场景理解能力?
  • RQ2将基于模型的先验与数据驱动的检测器相结合,是否能增强 6DoF 位姿估计的鲁棒性?
  • RQ3在生成式 3D 场景模型中进行概率推断,是否能够推断出完全遮挡物体的存在及其位姿?
  • RQ4使用合内 MCMC 进行场景图结构推断,是否能带来更高的采样效率和准确性?
  • RQ5与深度学习基线相比,3DP3 在新视角和具有挑战性的现实世界场景中的泛化能力如何?

主要发现

  • 3DP3 在真实世界和合成场景中的 6DoF 物体位姿估计精度高于深度学习基线方法,尤其在部分可观测性和遮挡条件下表现更优。
  • 该框架在未在训练中见过的新视角和复杂接触构型下,表现出更优的泛化能力。
  • 使用合内 MCMC 的推断能够高效探索场景图结构,提升了采样效率和结构一致性。
  • 在概率框架中集成神经网络检测器和位姿估计器,可通过常识性的几何约束纠正误差。
  • 3DP3 成功通过利用结构先验和场景级一致性,推断出完全遮挡物体的位姿。
  • 伪边缘推断方法能有效处理物体形状的不确定性,提升了对自遮挡和不完整数据的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。