Skip to main content
QUICK REVIEW

[论文解读] End-to-End Learning Local Multi-view Descriptors for 3D Point Clouds

Lei Li, Siyu Zhu|arXiv (Cornell University)|Mar 12, 2020
3D Shape Modeling and Analysis参考文献 66被引用 5
一句话总结

本文提出了一种用于3D点云局部多视角描述子的端到端深度学习框架,采用可微分渲染器优化视角,并引入软视角池化模块实现注意力特征融合。该方法在3DMatch数据集上达到最先进性能,并在户外场景中表现出良好的泛化能力,在ETH基准测试中平均召回率达到79.9%。

ABSTRACT

In this work, we propose an end-to-end framework to learn local multi-view descriptors for 3D point clouds. To adopt a similar multi-view representation, existing studies use hand-crafted viewpoints for rendering in a preprocessing stage, which is detached from the subsequent descriptor learning stage. In our framework, we integrate the multi-view rendering into neural networks by using a differentiable renderer, which allows the viewpoints to be optimizable parameters for capturing more informative local context of interest points. To obtain discriminative descriptors, we also design a soft-view pooling module to attentively fuse convolutional features across views. Extensive experiments on existing 3D registration benchmarks show that our method outperforms existing local descriptors both quantitatively and qualitatively.

研究动机与目标

  • 为解决多视角3D描述子学习中固定手工设计视角的局限性,将视角作为可学习参数。
  • 通过基于注意力机制且梯度友好的替代方案,取代最大池化,以改进多视角特征融合。
  • 通过可微分渲染器实现多视角渲染与描述子学习的联合优化。
  • 提升对噪声、不完整及低分辨率3D扫描(包括户外场景)的鲁棒性与泛化能力。
  • 在3D配准基准测试中超越现有手工设计与学习型局部描述子。

提出的方法

  • 在神经网络中集成可微分渲染器,将3D局部几何结构投影为多视角图像,其中视角作为可训练参数。
  • 使用CNN主干网络从每个渲染视图的图像块中提取卷积特征。
  • 提出一种软视角池化模块,为每个视图特征图计算注意力权重,实现自适应聚合。
  • 与最大池化相比,软视角池化层在反向传播过程中能实现更优的梯度流动。
  • 通过正负点对之间的对比损失,实现整个网络的端到端优化。
  • 在训练过程中对渲染视图图像块应用旋转增强,以提升对视角变化的鲁棒性。

实验结果

研究问题

  • RQ1在可微分渲染流程中,可优化的视角是否能提升多视角表示对3D局部描述子的信息量?
  • RQ2基于注意力机制的软视角池化方法是否在多视角3D描述子的特征融合中优于最大池化?
  • RQ3具有渲染与描述子学习联合优化能力的端到端可训练框架,是否能更好地泛化到真实世界中存在噪声、不完整和低分辨率的3D扫描?
  • RQ4在旋转变化与点云密度差异条件下,该方法在召回率与鲁棒性方面相较于最先进描述子表现如何?
  • RQ5视角选择策略与融合机制对户外、低分辨率扫描的泛化能力有何影响?

主要发现

  • 在ETH基准测试中,该方法在τ₂ = 0.05条件下实现79.9%的平均召回率,显著优于3DSmoothNet(79.0%)和LMVCNN(39.7%)。
  • 在3DMatch基准测试中,该方法在τ₂ = 0.05条件下实现97.5%的召回率,优于最大视图池化(96.9%)及其他融合方法。
  • 软视角池化模块在噪声多、分辨率低的户外扫描中,相比最大池化展现出更优的梯度流动与性能表现。
  • 通过端到端训练优化的可学习视角,其泛化能力优于随机采样、聚类或固定轨道排列规则。
  • 当描述子维度超过32或视角数量超过8时,性能趋于饱和,表明最优设置为d=32和n=8。
  • 该方法在户外场景中表现出良好泛化能力,在ETH数据集上实现79.9%的平均召回率,证明其对真实扫描伪影具有强鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。