Skip to main content
QUICK REVIEW

[论文解读] Deep Point Cloud Reconstruction

Jaesung Choe, Byeongin Joung|arXiv (Cornell University)|Nov 23, 2021
3D Shape Modeling and Analysis参考文献 68被引用 10
一句话总结

本文提出了一种新颖的两阶段深度学习框架,用于联合点云重建,同时解决3D扫描中的稀疏性、噪声和不完整性问题。该方法首先使用稀疏堆叠沙漏网络进行体素化密集化和去噪,随后通过引入增强位置编码的Transformer进行细化,将体素重新转换为高质量的3D点,从而在ScanNet、ICL-NUIM和ShapeNetPart数据集上实现最先进性能,并在真实场景中展现出强大的泛化能力。

ABSTRACT

Point cloud obtained from 3D scanning is often sparse, noisy, and irregular. To cope with these issues, recent studies have been separately conducted to densify, denoise, and complete inaccurate point cloud. In this paper, we advocate that jointly solving these tasks leads to significant improvement for point cloud reconstruction. To this end, we propose a deep point cloud reconstruction network consisting of two stages: 1) a 3D sparse stacked-hourglass network as for the initial densification and denoising, 2) a refinement via transformers converting the discrete voxels into 3D points. In particular, we further improve the performance of transformer by a newly proposed module called amplified positional encoding. This module has been designed to differently amplify the magnitude of positional encoding vectors based on the points' distances for adaptive refinements. Extensive experiments demonstrate that our network achieves state-of-the-art performance among the recent studies in the ScanNet, ICL-NUIM, and ShapeNetPart datasets. Moreover, we underline the ability of our network to generalize toward real-world and unmet scenes.

研究动机与目标

  • 为解决原始3D点云固有的局限性——稀疏性、噪声、不规则性和不完整性,提出统一的重建框架。
  • 克服先前方法将密集化、去噪和补全视为独立任务所导致的次优结果。
  • 开发一种可泛化的、与物体无关的方法,在未见场景和真实世界扫描中均表现良好。
  • 通过引入一种新颖的位置编码策略,提升基于Transformer的点云细化性能,该策略能根据空间频率和点间距自适应调整。

提出的方法

  • 采用两阶段架构:首先,利用稀疏卷积保留3D结构,通过稀疏堆叠沙漏网络实现体素生成与去噪。
  • 其次,通过体素重定位网络使用Transformer将离散体素转换为高分辨率3D点,实现精细重建。
  • 所提出的增强位置编码根据点间距调节位置嵌入的幅度,提升3D空间中高频细节的建模能力。
  • 在Transformer中同时利用自注意力与交叉注意力机制,有效捕捉局部与全局上下文信息。
  • 在每个沙漏模块中执行体素裁剪与生成,以保持结构一致性,避免稀疏输入导致的伪影。
  • 该框架端到端训练,并在标准基准上使用Chamfer距离和F-score进行评估。

实验结果

研究问题

  • RQ1能否通过在一个统一框架中联合求解密集化、去噪和补全,实现优于独立任务方法的点云重建性能?
  • RQ2与标准位置编码相比,所提出的增强位置编码在基于Transformer的点云细化中表现如何提升?
  • RQ3该方法在真实世界未见3D扫描和未见过的物体类别上的泛化能力如何?
  • RQ4自注意力与交叉注意力模块在基于Transformer的细化阶段中分别起到何种贡献?

主要发现

  • 所提方法在ScanNet、ICL-NUIM和ShapeNetPart数据集上达到最先进性能,在$ l_{\text{vox}} = 0.02 $和$ \rho_{\text{in}} = 2048 $条件下,ShapeNet-Part数据集上的Chamfer距离为1.195,F-score为55.488。
  • 消融实验表明,增强位置编码显著优于标准位置编码($\text{gamma}_{\text{PE}}$)和学习型PE*,Chamfer距离降低0.036。
  • 自注意力与交叉注意力模块的结合实现了最佳性能,优于仅使用单一注意力机制的模型。
  • 该模型在真实世界扫描中表现出良好泛化能力,无需微调即可在未见场景和未见过的物体类别上保持鲁棒性。
  • 仅体素生成网络的Chamfer距离为1.42,而完整两阶段系统将其降低至1.195,凸显了细化阶段的关键作用。
  • 该方法能有效处理稀疏和噪声输入,稀疏堆叠沙漏网络在第一阶段成功去除异常值并实现点云密集化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。