[论文解读] Inferring Point Clouds from Single Monocular Images by Depth Intermediation
本文提出了一种新颖的单图像3D点云重建流水线,首先估计深度图,然后利用相机几何作为约束完成完整的点云。该方法在ShapeNet和Pix3D数据集上优于最先进方法,通过3D-2D精炼模块实现对深度噪声的鲁棒性以及对真实世界图像的强大泛化能力,该模块强制对齐预测深度与生成的点云。
In this paper, we propose a pipeline to generate 3D point cloud of an object from a single-view RGB image. Most previous work predict the 3D point coordinates from single RGB images directly. We decompose this problem into depth estimation from single images and point cloud completion from partial point clouds. Our method sequentially predicts the depth maps from images and then infers the complete 3D object point clouds based on the predicted partial point clouds. We explicitly impose the camera model geometrical constraint in our pipeline and enforce the alignment of the generated point clouds and estimated depth maps. Experimental results for the single image 3D object reconstruction task show that the proposed method outperforms existing state-of-the-art methods. Both the qualitative and quantitative results demonstrate the generality and suitability of our method.
研究动机与目标
- 解决从单目RGB图像进行3D单视角重建时几何保真度不足的挑战。
- 通过在2D-3D域迁移中显式引入相机模型几何作为约束,减少对训练数据质量的依赖。
- 通过3D网格基表示编码部分点云,并使用基于折叠的解码器实现从稀疏到密集的点云生成,从而提升点云补全性能。
- 通过自监督的3D-2D精炼模块,联合优化深度估计与点云生成。
- 在合成数据集(ShapeNet)和真实世界数据集(Pix3D)上均实现最先进性能,并展现出对野外图像的强大泛化能力。
提出的方法
- 该流水线首先使用深度中间表示模块从单张RGB图像预测深度图。
- 利用相机几何将预测的深度图转换为部分3D点云,显式地将相机模型作为几何约束。
- 使用3D网格基点集对部分点云进行编码,以保留空间上下文信息并支持3D卷积神经网络处理。
- 3D卷积神经网络处理编码后的特征,随后通过基于折叠的解码器生成完整且稀疏的3D点云。
- 3D-2D精炼模块通过2D投影与3D监督,强制对齐生成的完整点云与预测的深度图,从而实现深度与补全模块的联合优化。
- 该方法在ShapeNet(合成)和Pix3D(真实世界)数据集上进行训练与评估,并对噪声鲁棒性与相机模型敏感性进行了消融研究。
实验结果
研究问题
- RQ1将相机几何显式用作约束,是否能提升从单张RGB图像进行3D重建的质量?
- RQ2与直接预测3D形状相比,深度中间表示在重建精度与鲁棒性方面表现如何?
- RQ33D-2D精炼模块在多大程度上减少了深度估计误差并提升了点云保真度?
- RQ4在合成数据上训练的模型,对具有多样化相机参数的真实世界野外图像的泛化能力如何?
- RQ53D网格大小与噪声鲁棒性对点云补全模块性能的影响如何?
主要发现
- 在ShapeNet椅子子集上,所提方法的Chamfer距离(CD)达到0.253,显著优于基线PSGN(CD为0.645)以及无3D-2D精炼模块的消融版本(CD为0.485)。
- 在相同基准上,该方法将交并比(IoU)提升至0.702,高于基线PSGN的0.544,以及无3D-2D精炼模块版本的0.626。
- 3D-2D精炼模块对深度噪声表现出强鲁棒性,仅当PSNR低于30dB时性能差距显著增大,表明对真实世界深度估计误差具有较强抗性。
- 该方法在真实世界图像上泛化良好,即使在未知相机参数与手动创建的掩码下测试,也能生成平滑且细节丰富的点云。
- 当焦距偏离真实值达20%时,模型仍保持鲁棒性,维持合理的重建质量,表明在相机模型假设不准确时仍具稳定性。
- 消融研究显示,将3D网格基大小从16³增加到32³可提升性能,32³在精度与效率之间取得良好平衡,因此被选为最优设置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。