Skip to main content
QUICK REVIEW

[论文解读] DH3D: Deep Hierarchical 3D Descriptors for Robust Large-Scale 6DoF Relocalization

Juan Du, Rui Wang|arXiv (Cornell University)|Jul 17, 2020
Robotics and Sensor-Based Localization参考文献 9被引用 9
一句话总结

该论文提出DH3D,一种统一的深度学习框架,能够在单次前向传播中联合完成从原始点云的3D关键点检测、局部特征描述和全局描述子提取。通过集成FlexConv和Squeeze-and-Excitation模块,该方法在大规模6DoF重定位任务中实现了最先进性能,并且在无需微调的情况下,对视觉SLAM生成的点云也展现出良好的泛化能力。

ABSTRACT

For relocalization in large-scale point clouds, we propose the first approach that unifies global place recognition and local 6DoF pose refinement. To this end, we design a Siamese network that jointly learns 3D local feature detection and description directly from raw 3D points. It integrates FlexConv and Squeeze-and-Excitation (SE) to assure that the learned local descriptor captures multi-level geometric information and channel-wise relations. For detecting 3D keypoints we predict the discriminativeness of the local descriptors in an unsupervised manner. We generate the global descriptor by directly aggregating the learned local descriptors with an effective attention mechanism. In this way, local and global 3D descriptors are inferred in one single forward pass. Experiments on various benchmarks demonstrate that our method achieves competitive results for both global point cloud retrieval and local point cloud registration in comparison to state-of-the-art approaches. To validate the generalizability and robustness of our 3D keypoints, we demonstrate that our method also performs favorably without fine-tuning on the registration of point clouds that were generated by a visual SLAM system. Code and related materials are available at https://vision.in.tum.de/research/vslam/dh3d.

研究动机与目标

  • 统一大规模3D重定位中的全局场景识别与局部6DoF位姿优化,克服传统分离式流水线方法的局限性。
  • 直接从原始点云中学习对噪声、旋转和下采样具有不变性的鲁棒3D局部描述子。
  • 通过在训练过程中学习判别性置信度图,实现无监督关键点检测。
  • 设计一种兼具判别性与鲁棒性的全局描述子,实现在多样化大规模场景中的精确检索。
  • 验证基于LiDAR训练的描述子在几何分布不同的视觉SLAM系统生成点云上的泛化能力。

提出的方法

  • 采用Siamese网络架构,联合从原始点云中学习3D局部特征检测与描述,共享主干网络进行特征编码。
  • 使用FlexConv通过在局部点邻域上学习自适应卷积核,捕捉多层级几何上下文。
  • 在局部特征编码器中集成Squeeze-and-Excitation(SE)模块,以建模通道间依赖关系,增强特征判别性。
  • 通过将局部描述子的判别性作为监督信号,端到端地无监督预测关键点检测的置信度图。
  • 通过注意力机制聚合局部描述子生成全局描述子,该机制对显著特征进行加权。
  • 整个流水线通过联合使用局部描述子损失、检测置信度损失和全局描述子对比损失,实现端到端训练。

实验结果

研究问题

  • RQ1能否通过单一深度神经网络,以统一方式联合优化3D关键点检测、局部特征描述与全局描述子学习,实现大规模6DoF重定位?
  • RQ2FlexConv与Squeeze-and-Excitation模块的集成在提升局部描述子质量与鲁棒性方面效果如何?
  • RQ3在LiDAR数据上训练的模型,能在多大程度上泛化到几何分布不同的视觉SLAM系统生成的点云?
  • RQ4基于描述子判别性的无监督关键点检测方法,是否优于传统手工设计或学习型检测方法?
  • RQ5所提出的局部与全局描述子在真实场景中面对噪声、旋转和下采样时,其鲁棒性如何?

主要发现

  • 在Oxford RobotCar数据集上,DH3D实现0.95°的旋转误差和0.23m的平移误差,6DoF配准成功率达到98.49%。
  • 在KITTI基准上,该方法实现1.58°的旋转误差和0.36m的平移误差,成功率达到90.6%,在视觉SLAM生成的点云上优于所有基线方法。
  • 消融实验表明,移除Squeeze-and-Excitation模块会导致成功率下降29%,证实其对描述子质量的关键作用。
  • 在高斯噪声σ = 0.15m和下采样因子α = 1.5以内的条件下,模型仍能保持超过90%的配准成功率,展现出强大的鲁棒性。
  • 全局描述子对噪声具有较高鲁棒性(性能维持至σ = 0.2m),但对旋转的鲁棒性较弱,表明在旋转不变性方面仍有改进空间。
  • 未经微调,基于LiDAR训练的模型在视觉SLAM点云上仍表现出良好泛化能力,在KITTI数据集上实现90.6%的成功率,显著优于基线方法(后者低于70%)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。