[论文解读] Multiview Based 3D Scene Understanding On Partial Point Sets
本文提出一种3D多视角表示方法,用于提升深度学习模型在完整和部分点云上的3D场景理解能力。通过使用来自360°扫描的基于多视角的部分点集增强训练数据,该方法在部分点集上的语义分割准确率提高了31.9%,在完整点集上提高了4.3%,同时在3D部件分割任务上也表现出良好的泛化能力。
Deep learning within the context of point clouds has gained much research interest in recent years mostly due to the promising results that have been achieved on a number of challenging benchmarks, such as 3D shape recognition and scene semantic segmentation. In many realistic settings however, snapshots of the environment are often taken from a single view, which only contains a partial set of the scene due to the field of view restriction of commodity cameras. 3D scene semantic understanding on partial point clouds is considered as a challenging task. In this work, we propose a processing approach for 3D point cloud data based on a multiview representation of the existing 360° point clouds. By fusing the original 360° point clouds and their corresponding 3D multiview representations as input data, a neural network is able to recognize partial point sets while improving the general performance on complete point sets, resulting in an overall increase of 31.9% and 4.3% in segmentation accuracy for partial and complete scene semantic understanding, respectively. This method can also be applied in a wider 3D recognition context such as 3D part segmentation.
研究动机与目标
- 解决由于相机视场限制导致在真实应用中常见的部分点云上的3D场景语义理解挑战。
- 克服现有深度学习模型仅在完整360°点云上进行训练而难以泛化到部分真实扫描数据的局限性。
- 开发一种数据表示策略,提升模型对部分观测的鲁棒性,而无需完全依赖数据增强。
- 证明基于多视角的部分点集作为通用预处理技术在3D识别任务(超越场景分割)中的有效性。
提出的方法
- 通过从多个视角投影360°点云,生成基于多视角的部分点集,模拟具有视场限制的真实相机快照。
- 保持原始点云的3D几何结构,而非将其转换为2D图像,以保留空间关系供深度学习使用。
- 使用原始360°点云与多视角生成的部分点集组合数据集训练深度神经网络,以提升泛化能力。
- 基于理论框架证明:若完整场景的关键点集可从部分视角中重建,则完整数据可被多视角集合替代而性能不变。
- 将该方法应用于场景语义分割和3D部件分割任务,验证其在不同任务间的泛化能力。
- 优化多视角部分点集的数量,以在完整点云和部分点云识别性能之间取得平衡,识别出性能权衡。
实验结果
研究问题
- RQ1在360°点云上训练的深度神经网络能否有效泛化到真实相机拍摄的视场受限的部分点集?
- RQ2在完整和不完整数据上,引入基于多视角的部分点集在3D语义分割性能上的提升程度如何?
- RQ3所提出的多视角表示是否在不增加训练样本数量的情况下依然有效,表明其并非单纯的增强技巧?
- RQ4该多视角表示能否泛化到场景级语义分割之外的细粒度任务,如3D部件分割?
- RQ5多视角部分点集的数量与模型识别完整点云和部分点云能力之间存在何种权衡?
主要发现
- 与基线相比,所提方法在部分点云语义分割上的平均交并比(mIoU)提升了31.9%。
- 该方法在完整360°点云上的mIoU也提升了4.3%,表明对部分和完整数据均具有双重优势。
- 即使在训练中完全移除原始360°点云,改用每场景300个多视角部分点集,模型在完整数据上的性能仍保持相当。
- 该方法在3D部件分割任务上也表现出有效泛化,在ShapeNet部件数据集的16个物体类别中,有15个类别实现了稳定的mIoU提升。
- 观察到性能权衡:随着多视角部分点集数量的增加,完整和部分数据的识别性能最初提升,但超过某一阈值后,完整数据的性能开始下降。
- 理论分析证实:若完整场景的关键点集可从部分视角中重建,则完整数据可被多视角集合替代而不会造成性能损失。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。