Skip to main content
QUICK REVIEW

[论文解读] A Skeleton-bridged Deep Learning Approach for Generating Meshes of Complex Topologies from Single RGB Images

Jiapeng Tang, Xiaoguang Han|arXiv (Cornell University)|Mar 12, 2019
3D Shape Modeling and Analysis参考文献 37被引用 9
一句话总结

本文提出一种基于骨骼桥接的分阶段深度学习框架,能够从单张RGB图像生成高质量的复杂拓扑结构3D网格重建结果。通过采用一种新颖的并行解码器,分别处理曲线状与表面状骨骼点,再结合体素优化与图卷积网格变形,该方法在重建细长、复杂的结构时,实现了最先进的性能,同时保持了拓扑一致性。

ABSTRACT

This paper focuses on the challenging task of learning 3D object surface reconstructions from single RGB images. Existing methods achieve varying degrees of success by using different geometric representations. However, they all have their own drawbacks, and cannot well reconstruct those surfaces of complex topologies. To this end, we propose in this paper a skeleton-bridged, stage-wise learning approach to address the challenge. Our use of skeleton is due to its nice property of topology preservation, while being of lower complexity to learn. To learn skeleton from an input image, we design a deep architecture whose decoder is based on a novel design of parallel streams respectively for synthesis of curve- and surface-like skeleton points. We use different shape representations of point cloud, volume, and mesh in our stage-wise learning, in order to take their respective advantages. We also propose multi-stage use of the input image to correct prediction errors that are possibly accumulated in each stage. We conduct intensive experiments to investigate the efficacy of our proposed approach. Qualitative and quantitative results on representative object categories of both simple and complex topologies demonstrate the superiority of our approach over existing ones. We will make our ShapeNet-Skeleton dataset publicly available.

研究动机与目标

  • 为解决从单张RGB图像重建3D表面的挑战,特别是针对具有复杂拓扑结构(如带细长结构的椅子和桌子)的物体。
  • 克服现有方法在网格生成过程中难以保持拓扑结构与几何保真度的局限性。
  • 利用骨骼表示的拓扑稳定性与较低的学习复杂度,作为实现高精度3D重建的桥梁。
  • 设计一种分阶段学习流程,整合点云、体素与网格表示,以充分发挥各自优势。
  • 通过在多个阶段重用输入图像,纠正误差累积,从而提升最终网格质量。

提出的方法

  • 提出一种新颖的深度神经网络架构,包含两条并行分支——CurSkeNet与SurSkeNet,分别从单张RGB图像中独立建模曲线状与表面状骨骼成分,实现骨骼点的生成。
  • 将推断出的骨骼转换为粗粒度的体素表示,并通过使用全局结构正则化的子体积合成技术,利用3D卷积神经网络(3D CNN)进行优化,以降低计算成本。
  • 引入一种基于体素的校正网络,用于在网格提取前纠正初始骨骼推断中的误差。
  • 采用标准提取方法(如移动立方体法)从优化后的体素中提取基础网格,作为变形的初始几何形状。
  • 训练图卷积网络(GCNN)以变形基础网格的顶点,通过端到端优化学习精细的几何细节。
  • 在整个流程中多阶段重用输入图像,以纠正预测误差,提升重建精度。

实验结果

研究问题

  • RQ1与直接基于网格或体素的方法相比,基于骨骼桥接的方法是否能显著提升复杂拓扑结构物体的3D网格重建质量?
  • RQ2并行分支在学习曲线状与表面状骨骼点方面的有效性如何?是否能有效捕捉多样的骨骼结构?
  • RQ3多阶段重用输入图像在多大程度上减少了误差累积,并提升了最终网格的保真度?
  • RQ4以分阶段方式整合点云、体素与网格表示,是否优于端到端或单表示方法?
  • RQ5基于体素的校正步骤是否能通过减轻骨骼推断不准确带来的误差,显著提升网格质量?

主要发现

  • 在骨骼推断基准测试中,所提方法在所有变体中取得了最低的Chamfer距离(1.103 × 10³),优于仅使用点、仅使用线、仅使用方形拟合以及组合拟合的方法。
  • 引入拉普拉斯平滑损失显著提升了视觉质量并减少了噪声;定性对比显示,其他模型因无法捕捉细长结构而失败。
  • 视觉对比表明,所提方法能成功重建复杂拓扑结构,如细长的桌腿与杆件,而基于OGN的基线模型因拓扑错误而失败。
  • 基于体素的校正网络有效减少了从骨骼推断到网格生成过程中的误差传播,其有效性在消融研究中得到验证。
  • 与现有方法相比,该方法生成的网格在准确性与拓扑正确性方面表现更优,尤其在具有长而细的部件的挑战性物体类别上。
  • 消融研究证实了分阶段设计的有效性,其中每个组件——骨骼学习、体素校正与网格变形——均对最终性能提升有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。