Skip to main content
QUICK REVIEW

[论文解读] Learning 3D Segment Descriptors for Place Recognition

Andrei Cramariuc, Renaud Dubé|arXiv (Cornell University)|Apr 24, 2018
Robotics and Sensor-Based Localization参考文献 11被引用 9
一句话总结

该论文提出了一种基于深度学习的方法,从激光雷达点云中生成视角不变的3D分割描述符,以提升SLAM系统中的场景识别性能。通过三种CNN架构——孪生网络、对比损失网络和基于分组的特征提取器,作者证明了学习得到的描述符显著优于传统的基于特征值的描述符,在候选检索中实现了高达50%的真正匹配率,分类准确率超过80%。

ABSTRACT

In the absence of global positioning information, place recognition is a key capability for enabling localization, mapping and navigation in any environment. Most place recognition methods rely on images, point clouds, or a combination of both. In this work we leverage a segment extraction and matching approach to achieve place recognition in Light Detection and Ranging (LiDAR) based 3D point cloud maps. One challenge related to this approach is the recognition of segments despite changes in point of view or occlusion. We propose using a learning based method in order to reach a higher recall accuracy then previously proposed methods. Using Convolutional Neural Networks (CNNs), which are state-of-the-art classifiers, we propose a new approach to segment recognition based on learned descriptors. In this paper we compare the effectiveness of three different structures and training methods for CNNs. We demonstrate through several experiments on real-world data collected in an urban driving scenario that the proposed learning based methods outperform hand-crafted descriptors.

研究动机与目标

  • 通过学习视角和遮挡不变的3D分割描述符,提升基于激光雷达的SLAM系统中场景识别的鲁棒性。
  • 解决手工设计描述符(如基于特征值的方法)在视角变化和遮挡条件下进行分割匹配时的局限性。
  • 评估并比较多种深度学习架构和训练策略在3D点云分割描述符学习中的表现。
  • 证明学习得到的描述符在真实世界城市驾驶数据上可实现比现有方法更高的召回率和准确率。
  • 在保持高描述符质量的同时,优化网络以实现实时性能,便于在SLAM系统中部署。

提出的方法

  • 实现了三种基于CNN的描述符学习方法:使用对比损失的孪生网络、使用对比损失训练的特征提取网络,以及基于分组的分类器(采用共享特征提取器)。
  • 通过3D卷积层从3D点云分割中提取描述符,将中间激活值作为最终的描述符表示。
  • 孪生网络通过最小化匹配分割对之间描述符的欧氏距离,同时最大化非匹配对之间的距离进行训练。
  • 基于对比损失的网络通过拉近相似对的距离、推开非相似对的距离,学习具有判别性的特征。
  • 基于分组的分类器使用共享CNN提取描述符,并通过随机森林分类器判断两个描述符是否匹配,基于其拼接结果进行分类。
  • 所有方法均在KITTI数据集上进行评估,使用真实世界城市激光雷达扫描数据,性能通过ROC曲线和基于最近邻搜索的候选匹配准确率进行衡量。

实验结果

研究问题

  • RQ1基于深度学习的描述符是否能在3D分割匹配任务中超越传统的基于特征值的描述符,用于场景识别?
  • RQ2在视角变化和遮挡条件下,哪种CNN架构和训练策略(孪生网络、对比损失、基于分组)在分割匹配中能实现最高准确率?
  • RQ3在描述符空间中使用最近邻搜索检索候选匹配时,不同学习方法在召回率和精确率方面如何比较?
  • RQ4描述符准确率与计算吞吐量之间存在何种权衡?网络是否可优化以实现实时SLAM部署?
  • RQ5与手工设计方法相比,学习得到的描述符在多大程度上实现了视角和遮挡不变性?

主要发现

  • 孪生网络在区分匹配与非匹配分割对方面实现了约80%的最高分类准确率。
  • 基于分组的特征提取网络和基于对比损失训练的网络在16,000个分割的测试集中,均实现了约50%的真正匹配率。
  • 原始SegMatch方法中使用的基于特征值的描述符仅实现了6%的真正匹配率,表明性能存在显著差距。
  • 所有基于CNN的方法在分类和候选匹配任务中均显著优于基线的基于特征值描述符。
  • 优化后的CNN在GPU上实现了每秒340个分割的吞吐量,支持实时部署,同时保持了高准确率。
  • 使用对比损失或基于分组的学习策略,相比简单特征提取,能强制生成更具鲁棒性的描述符,从而提升泛化能力和不变性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。