Skip to main content
QUICK REVIEW

[论文解读] DeepMapping: Unsupervised Map Estimation From Multiple Point Clouds

Li Ding, Chen Feng|arXiv (Cornell University)|Nov 28, 2018
Robotics and Sensor-Based Localization参考文献 53被引用 6
一句话总结

DeepMapping 提出了一种无监督深度学习框架,将点云配准问题转化为两个深度神经网络的端到端训练——L-Net 用于姿态估计,M-Net 用于全局场景占据映射,损失函数采用二元交叉熵和 Chamfer 距离。该方法在模拟和真实数据集上均实现了鲁棒、对初始化不敏感的全局配准,优于 ICP 和多路配准基线方法。

ABSTRACT

We propose DeepMapping, a novel registration framework using deep neural networks (DNNs) as auxiliary functions to align multiple point clouds from scratch to a globally consistent frame. We use DNNs to model the highly non-convex mapping process that traditionally involves hand-crafted data association, sensor pose initialization, and global refinement. Our key novelty is that "training" these DNNs with properly defined unsupervised losses is equivalent to solving the underlying registration problem, but less sensitive to good initialization than ICP. Our framework contains two DNNs: a localization network that estimates the poses for input point clouds, and a map network that models the scene structure by estimating the occupancy status of global coordinates. This allows us to convert the registration problem to a binary occupancy classification, which can be solved efficiently using gradient-based optimization. We further show that DeepMapping can be readily extended to address the problem of Lidar SLAM by imposing geometric constraints between consecutive point clouds. Experiments are conducted on both simulated and real datasets. Qualitative and quantitative comparisons demonstrate that DeepMapping often enables more robust and accurate global registration of multiple point clouds than existing techniques. Our code is available at https://ai4ce.github.io/DeepMapping/.

研究动机与目标

  • 为解决从任意初始姿态全局对齐多个点云的挑战,且不依赖手工设计特征或良好初始化。
  • 将非凸、连续的配准问题重新表述为使用深度神经网络的可微分二值占据分类任务。
  • 开发一种对姿态初始化不敏感的框架,优于传统方法(如 ICP),从而实现更鲁棒和精确的全局配准。
  • 证明无监督深度学习在 3D 地图构建和 Lidar SLAM 等几何视觉任务中的可行性。

提出的方法

  • 该框架采用两个深度神经网络:L-Net 估计每个输入点云的 6-DoF 姿态,M-Net 预测全局 3D 坐标的占据状态以建模场景结构。
  • 将配准任务转化为二值分类问题,其中 M-Net 输出表示每个 3D 坐标是否被占据的概率图,从而支持基于梯度的优化。
  • 使用无监督损失函数——占据预测的二元交叉熵(BCE)和预测点云与真实点云之间的 Chamfer 距离——实现无需监督的端到端网络训练。
  • 采用可微分采样策略,将点云射线投影到 M-Net 的 3D 网格中,实现对占据预测的反向传播。
  • 通过在训练期间对连续点云施加几何约束,将该框架扩展至 Lidar SLAM。
  • 通过随机梯度下降进行优化,整个系统使用 BCE 和 Chamfer 损失的组合实现端到端训练。

实验结果

研究问题

  • RQ1能否在无监督方式下训练深度神经网络,以解决全局点云配准问题,且无需良好初始姿态?
  • RQ2能否有效利用深度学习将复杂的非凸映射过程建模为可微分的二值占据分类任务?
  • RQ3所提出的无监督训练框架在对初始化的鲁棒性和准确性方面,与传统 ICP 和多路配准方法相比如何?
  • RQ4在重叠率较低的情况下,引入 Chamfer 距离损失是否能提升配准质量?

主要发现

  • DeepMapping 在配准精度方面优于 ICP 和多路配准基线方法,尤其在低重叠率场景下表现更优,如 Active Vision 数据集上的定性结果所示。
  • 与 ICP 相比,该方法对姿态初始化的敏感性显著降低,在初始对齐较差的真实世界场景中表现出更强的鲁棒性。
  • 结合 Chamfer 距离损失与 BCE 损失可提升配准精度,尤其在点云稀疏区域表现更优。
  • 在 Active Vision 数据集上,DeepMapping 在 ATE(绝对轨迹误差)和点到点距离指标上均优于多路配准方法,且中位数和四分位距更低。
  • 该框架能够从任意初始姿态成功配准多个点云,实现对复杂室内场景(如楼梯和面状结构)的精确重建。
  • 可视化结果表明,DeepMapping 能够正确对齐其他方法失败的挑战性结构,突出区域无错位现象。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。