Skip to main content
QUICK REVIEW

[论文解读] SelfVoxeLO: Self-supervised LiDAR Odometry with Voxel-based Deep Neural Networks

Yan Xu, Zhaoyang Huang|arXiv (Cornell University)|Oct 19, 2020
Robotics and Sensor-Based Localization参考文献 30被引用 10
一句话总结

本文提出 SelfVoxeLO,一种自监督的激光雷达里程计方法,利用基于体素的三维卷积神经网络直接处理原始激光雷达点云,避免了二维投影带来的失真。该方法引入了新颖的自监督损失函数以及一种不确定性感知机制,提升了对噪声和动态物体的鲁棒性,在 KITTI 和 Apollo-SouthBay 数据集上实现了最先进性能,并支持实时推理。

ABSTRACT

Recent learning-based LiDAR odometry methods have demonstrated their competitiveness. However, most methods still face two substantial challenges: 1) the 2D projection representation of LiDAR data cannot effectively encode 3D structures from the point clouds; 2) the needs for a large amount of labeled data for training limit the application scope of these methods. In this paper, we propose a self-supervised LiDAR odometry method, dubbed SelfVoxeLO, to tackle these two difficulties. Specifically, we propose a 3D convolution network to process the raw LiDAR data directly, which extracts features that better encode the 3D geometric patterns. To suit our network to self-supervised learning, we design several novel loss functions that utilize the inherent properties of LiDAR point clouds. Moreover, an uncertainty-aware mechanism is incorporated in the loss functions to alleviate the interference of moving objects/noises. We evaluate our method's performances on two large-scale datasets, i.e., KITTI and Apollo-SouthBay. Our method outperforms state-of-the-art unsupervised methods by 27%/32% in terms of translational/rotational errors on the KITTI dataset and also performs well on the Apollo-SouthBay dataset. By including more unlabelled training data, our method can further improve performance comparable to the supervised methods.

研究动机与目标

  • 解决基于二维投影的激光雷达里程计方法存在的局限性,后者会扭曲三维几何结构并降低特征质量。
  • 通过实现无需真实位姿标注的自监督训练,克服监督学习对大规模标注数据的依赖。
  • 通过损失函数中引入不确定性感知的置信度估计机制,提升对噪声和动态物体的鲁棒性。
  • 仅使用未标注数据,在 KITTI 和 Apollo-SouthBay 等大规模基准数据集上实现最先进性能。
  • 通过优化推理效率,在保持高精度的同时实现实时部署。

提出的方法

  • 将原始激光雷达点云体素化为细粒度的三维网格,以保留空间拓扑结构并支持三维卷积特征学习。
  • 采用三维卷积神经网络,直接从体素化点云中提取分层几何特征。
  • 引入球面重投影损失,通过利用角度一致性和距离一致性,促使网络关注邻近且稳定的点。
  • 应用变换残差损失,通过最小化预测位姿变化的偏差来稳定训练过程。
  • 引入深度光流监督损失,通过帧间特征一致性增强逐点特征学习。
  • 利用网络预测结果估计对应点对的置信度分数,并将其用于加权损失函数,降低噪声或动态点的影响。

实验结果

研究问题

  • RQ1基于体素的三维卷积神经网络框架是否能在捕捉激光雷达里程计的三维几何结构方面优于基于二维投影的方法?
  • RQ2如何设计自监督损失函数,以在无任何标注位姿的情况下训练激光雷达里程计网络?
  • RQ3不确定性感知的置信度估计在多大程度上能提升对动态物体和传感器噪声的鲁棒性?
  • RQ4自监督方法是否能在真实世界数据集上实现与监督方法最先进水平相当的性能?
  • RQ5所提出的方法是否能保持适合实际机器人和自动驾驶应用的实时推理效率?

主要发现

  • 在 KITTI 数据集上,与最先进无监督方法相比,SelfVoxeLO 的平移误差和旋转误差分别相对降低了 27% 和 32%。
  • 在 Apollo-SouthBay 数据集上,该方法优于大多数两帧基线方法,并与采用地图优化的多帧 LOAM 方法性能相当。
  • 消融实验证实,若移除置信度机制,性能显著下降,证明其在过滤不可靠对应点方面的有效性。
  • 将球面重投影损失替换为欧氏距离损失后,性能出现明显下降,验证了球面损失设计的合理性。
  • 在 V100 GPU 上,模型每帧推理耗时 88.4 ms,实现实时推理,且速度优于传统的 ICP 方法。
  • 在大规模未标注数据和地图优化的加持下,该方法的性能可与监督方法 LO-net 相媲美,展现出强大的泛化能力和可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。