Skip to main content
QUICK REVIEW

[论文解读] CAPNet: Continuous Approximation Projection For 3D Point Cloud Reconstruction Using 2D Supervision

K L Navaneet, Priyanka Mandikal|arXiv (Cornell University)|Nov 28, 2018
Advanced Vision and Imaging参考文献 20被引用 4
一句话总结

CAPNet 引入了一个可微分的连续近似投影模块,使仅使用前景掩码等 2D 监督信号即可实现弱监督的 3D 点云重建。通过将投影建模为 3D 点的平滑连续函数,并引入亲和力损失以抑制异常点,CAPNet 在合成数据集和真实世界数据集上均实现了最先进性能,即使仅使用单张掩码作为监督信号也表现优异,并支持测试时优化以提升图像对应关系。

ABSTRACT

Knowledge of 3D properties of objects is a necessity in order to build effective computer vision systems. However, lack of large scale 3D datasets can be a major constraint for data-driven approaches in learning such properties. We consider the task of single image 3D point cloud reconstruction, and aim to utilize multiple foreground masks as our supervisory data to alleviate the need for large scale 3D datasets. A novel differentiable projection module, called 'CAPNet', is introduced to obtain such 2D masks from a predicted 3D point cloud. The key idea is to model the projections as a continuous approximation of the points in the point cloud. To overcome the challenges of sparse projection maps, we propose a loss formulation termed 'affinity loss' to generate outlier-free reconstructions. We significantly outperform the existing projection based approaches on a large-scale synthetic dataset. We show the utility and generalizability of such a 2D supervised approach through experiments on a real-world dataset, where lack of 3D data can be a serious concern. To further enhance the reconstructions, we also propose a test stage optimization procedure to obtain reconstructions that display high correspondence with the observed input image.

研究动机与目标

  • 为解决大规模 3D 数据集稀缺的问题,通过仅使用前景掩码等 2D 监督信号实现 3D 点云重建。
  • 克服传统点云投影方法中不可微分和稀疏性的问题。
  • 通过引入点云投影的可微分、连续近似方法,提升重建质量。
  • 提出一种新型损失函数——亲和力损失,有效抑制稀疏投影图中的异常点。
  • 在真实世界数据集上展示方法的泛化能力,仅需极少 3D 监督,并支持使用观测掩码进行测试时优化。

提出的方法

  • 提出一种连续近似投影模块,利用可学习方差的高斯核将 2D 投影建模为 3D 点云坐标的可微分、平滑函数。
  • 基于核密度估计设计可微分渲染过程,从稀疏 3D 点云生成平滑、无伪影的 2D 投影。
  • 引入亲和力损失,通过惩罚孤立或不连通的点来增强投影掩码的空间一致性,从而减少异常点生成。
  • 采用多视角训练设置,利用来自不同视角的多张 2D 掩码监督 3D 重建过程。
  • 应用测试时优化(TSO)流程,通过输入图像的前景掩码微调预测的点云,以提升几何和结构对应关系。
  • 采用混合损失,结合二元交叉熵损失与亲和力损失,以平衡掩码准确率与重建的结构保真度。

实验结果

研究问题

  • RQ1能否设计一种可微分、连续的投影模块,仅使用前景掩码等 2D 监督信号实现弱监督的 3D 点云重建?
  • RQ2在大多数区域无投影点的稀疏投影图中,如何保持梯度传播?
  • RQ3单张 2D 掩码在无完整 3D 监督的情况下,能在多大程度上实现高质量 3D 重建?
  • RQ4使用观测掩码进行测试时优化,能否显著提升重建 3D 点云与输入图像之间的对应关系?
  • RQ5与标准交叉熵损失相比,所提出的亲和力损失在抑制异常点和提升重建质量方面表现如何?

主要发现

  • 在大规模合成数据集上,CAPNet 显著优于现有基于投影的方法,所有类别均实现了更低的 Chamfer 距离。
  • 仅使用单张前景掩码作为监督时,模型表现具有竞争力——在真实世界数据集上,飞机类 Chamfer 距离为 2.01,汽车类为 1.65。
  • 测试时优化(TSO)流程提升了重建质量,经优化的点云在几何和结构上与输入图像的对应关系更优,尤其在遮挡区域表现更佳。
  • 亲和力损失有效减少了异常点,定性结果和更低的 Chamfer 分数表明其优于仅使用二元交叉熵损失训练的模型。
  • 该方法在真实世界数据上泛化良好,表明结合连续投影与合理损失设计后,2D 监督足以实现高质量 3D 重建。
  • 训练时使用的视角数量在超过两个投影后收益递减,性能在 2–3 个视角时趋于稳定,表明具有极强的样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。