Skip to main content
QUICK REVIEW

[论文解读] Single-view Object Shape Reconstruction Using Deep Shape Prior and Silhouette

Kejie Li, Ravi Garg|arXiv (Cornell University)|Nov 29, 2018
Advanced Vision and Imaging参考文献 67被引用 5
一句话总结

本文提出了一种单视角3D形状重建方法,利用深度自编码器学习潜在形状空间,并通过高斯混合模型(GMM)建模为概率形状先验。在推理阶段,该方法联合优化形状与姿态,结合真实图像语义分割网络的轮廓一致性与GMM先验,实现了无需端到端训练或合成数据的最先进性能,表明显式形状先验可与基于深度学习的方法相媲美。

ABSTRACT

3D shape reconstruction from a single image is a highly ill-posed problem. Modern deep learning based systems try to solve this problem by learning an end-to-end mapping from image to shape via a deep network. In this paper, we aim to solve this problem via an online optimization framework inspired by traditional methods. Our framework employs a deep autoencoder to learn a set of latent codes of 3D object shapes, which are fitted by a probabilistic shape prior using Gaussian Mixture Model (GMM). At inference, the shape and pose are jointly optimized guided by both image cues and deep shape prior without relying on an initialization from any trained deep nets. Surprisingly, our method achieves comparable performance to state-of-the-art methods even without training an end-to-end network, which shows a promising step in this direction.

研究动机与目标

  • 通过整合深度形状先验与基于图像的约束,解决单视角3D形状重建的病态性问题。
  • 通过使用现成分割网络生成的真实图像轮廓,而非合成数据,减少3D重建中的域差距。
  • 探究端到端深度学习是否为高性能单视角重建所必需。
  • 开发一种透明的、基于优化的框架,在推理阶段强制执行几何一致性(轮廓与形状先验)。
  • 证明在深度潜在空间中学习的GMM先验可有效约束形状搜索,获得真实、类物体的解。

提出的方法

  • 在3D形状数据集上训练一个深度点云自编码器,以学习紧凑且解耦的潜在表示。
  • 使用高斯混合模型(GMM)对自编码器的潜在码进行建模,形成潜在空间上的概率形状先验。
  • 在推理阶段,通过在线优化框架联合优化潜在码与物体姿态,以最小化轮廓误差并最大化GMM似然。
  • 轮廓从预训练的语义分割网络(如基于MSCOCO的模型)获取,避免因使用合成数据导致的域偏移。
  • 优化目标结合轮廓一致性(L_sil)与形状先验似然(L_shape),实现鲁棒且真实的重建。
  • 初始化采用GMM各分量的均值潜在码,避免依赖预训练的图像到形状网络。

实验结果

研究问题

  • RQ1非端到端、基于优化的方法是否能在不依赖端到端深度网络的情况下实现具有竞争力的3D重建性能?
  • RQ2基于学习的GMM形状先验在多大程度上提升了重建质量,并有效防止对噪声轮廓的过拟合?
  • RQ3来自现成分割模型的真实图像轮廓是否能有效替代单视角3D重建中的合成监督?
  • RQ4在未对真实图像进行显式训练的情况下,轮廓一致性与形状先验的结合如何强制实现几何合理性?
  • RQ5经GMM先验正则化的深度自编码器所学习的潜在空间,是否能捕捉到有意义且解耦的物体结构?

主要发现

  • 该方法在真实图像上实现了最先进性能,且未使用任何合成数据或端到端训练,优于多个专用深度学习模型。
  • 在Pix3D基准上,该方法在椅子类别上实现了0.116的Chamfer距离(CD)与0.125的Earth Mover’s Distance(EMD),优于DRC与MarrNet等方法。
  • 消融实验表明,仅使用轮廓一致性会导致形状差、不真实,因过拟合;加入GMM形状先验可显著提升重建质量。
  • GMM先验能有效抑制潜在空间中的非物理形状,低似然区域(图4中的蓝色区域)对应于不合理的形状插值。
  • 在GMM分量均值之间(如四条腿椅子与旋转椅)进行线性插值,会导致低GMM似然,证实先验有效强制结构合理性。
  • 该方法对噪声轮廓具有鲁棒性,由于轮廓一致性与形状先验似然的双重约束,能保持高质量重建。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。