Skip to main content
QUICK REVIEW

[论文解读] Inverse Graphics with Probabilistic CAD Models

Tejas D. Kulkarni, Vikash K. Mansinghka|arXiv (Cornell University)|Jul 4, 2014
Human Pose and Action Recognition参考文献 14被引用 15
一句话总结

该论文提出了一种概率CAD(PCAD)框架,通过使用随机程序对可变形3D网格及其场景布局进行建模,实现了3D视觉任务中的近似贝叶斯推断。该方法通过结合哈密顿蒙特卡洛、Metropolis-Hastings提议以及从合成数据中学得的判别式数据驱动提议,在单幅图像的3D人体姿态估计和物体形状重建任务中取得了最先进性能。

ABSTRACT

Recently, multiple formulations of vision problems as probabilistic inversions of generative models based on computer graphics have been proposed. However, applications to 3D perception from natural images have focused on low-dimensional latent scenes, due to challenges in both modeling and inference. Accounting for the enormous variability in 3D object shape and 2D appearance via realistic generative models seems intractable, as does inverting even simple versions of the many-to-many computations that link 3D scenes to 2D images. This paper proposes and evaluates an approach that addresses key aspects of both these challenges. We show that it is possible to solve challenging, real-world 3D vision problems by approximate inference in generative models for images based on rendering the outputs of probabilistic CAD (PCAD) programs. Our PCAD object geometry priors generate deformable 3D meshes corresponding to plausible objects and apply affine transformations to place them in a scene. Image likelihoods are based on similarity in a feature space based on standard mid-level image representations from the vision literature. Our inference algorithm integrates single-site and locally blocked Metropolis-Hastings proposals, Hamiltonian Monte Carlo and discriminative data-driven proposals learned from training data generated from our models. We apply this approach to 3D human pose estimation and object shape reconstruction from single images, achieving quantitative and qualitative performance improvements over state-of-the-art baselines.

研究动机与目标

  • 为解决自然图像理解中复杂3D到2D渲染映射的不可逆性问题。
  • 通过概率CAD程序和非参数先验,对丰富的3D形状与外观可变性进行建模。
  • 在高维、混合离散-连续潜在空间中,实现真实3D视觉任务的高效且精确的推断。
  • 将判别式数据驱动提议整合到生成建模框架中,以提升推断速度与准确性。
  • 展示利用生成模型从单张自然图像实现可扩展的、显式的3D场景感知的可行性。

提出的方法

  • 使用概率CAD(PCAD)程序定义随机场景生成器,从如高斯过程等非参数先验中采样3D网格和仿射变换。
  • 使用通用渲染引擎从3D场景样本生成中层图像表征(如边缘图、HOG类特征),用于似然计算。
  • 采用混合推断策略,结合单点与局部块状Metropolis-Hastings、哈密顿蒙特卡洛以及来自训练检测器的判别式提议。
  • 通过在合成训练数据中DPM检测姿态的潜在变量上进行核密度估计,学习判别式提议,从而提升提议质量。
  • 在中层表征空间中,使用距离度量将渲染特征与真实图像特征进行比较,以定义图像似然。
  • 将整个系统视为生成式概率图形程序,实现3D感知的端到端贝叶斯反演。

实验结果

研究问题

  • RQ1概率CAD程序能否实现自然图像中3D形状与外观可变性的可扩展且逼真的建模?
  • RQ2在具有复杂多对多渲染映射的高维、混合离散-连续潜在空间中,如何实现高效推断?
  • RQ3数据驱动的判别式提议在多大程度上能提升生成式3D视觉模型中贝叶斯推断的速度与准确性?
  • RQ4完全生成式、近似贝叶斯方法能否在3D人体姿态估计与物体重建任务中超越判别式基线?
  • RQ5是否可行构建一个系统,利用显式3D场景表征与概率推断,从单张自然图像实现丰富的3D场景解析?

主要发现

  • 所提方法在无需预分割物体的情况下,在3D物体重建任务中显著优于SIRFS及其他SOTA基线方法。
  • 从合成数据中学得的判别式提议显著加速收敛并提升后验准确性,100条独立MCMC链的实验结果(有/无此类提议)已证实该效果。
  • 采用学习提议的推断收敛更快,且达到更高的后验似然,多个测试案例中均表现出一致的性能提升。
  • 系统成功逃离复杂能量景观中的局部极小值,推断轨迹显示从先验到后验的渐进式优化过程。
  • 由于对3D网格组件与形变采用非参数先验,模型在未见物体类别和复杂形状上泛化能力出色。
  • 该框架即使在单张自然图像下,也能生成语义上合理的3D网格与准确的姿态估计,实现高质量的定性结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。