[论文解读] CVTNet: A Cross-View Transformer Network for Place Recognition Using LiDAR Data
CVTNet 提出了一种跨视角变换器网络,通过融合来自激光雷达数据的多层距离图像视图(RIVs)和鸟瞰图(BEVs),生成对偏航角不变的全局描述符,实现鲁棒且实时的场景识别。通过利用视图内和视图间变换器模块来建模视图内及视间的相关性,CVTNet 在包括 NCLT、KITTI 和自建数据集在内的大规模室外数据集上实现了最先进性能,推理速度超过 29 Hz,快于典型激光雷达帧率。
LiDAR-based place recognition (LPR) is one of the most crucial components of autonomous vehicles to identify previously visited places in GPS-denied environments. Most existing LPR methods use mundane representations of the input point cloud without considering different views, which may not fully exploit the information from LiDAR sensors. In this paper, we propose a cross-view transformer-based network, dubbed CVTNet, to fuse the range image views (RIVs) and bird's eye views (BEVs) generated from the LiDAR data. It extracts correlations within the views themselves using intra-transformers and between the two different views using inter-transformers. Based on that, our proposed CVTNet generates a yaw-angle-invariant global descriptor for each laser scan end-to-end online and retrieves previously seen places by descriptor matching between the current query scan and the pre-built database. We evaluate our approach on three datasets collected with different sensor setups and environmental conditions. The experimental results show that our method outperforms the state-of-the-art LPR methods with strong robustness to viewpoint changes and long-time spans. Furthermore, our approach has a good real-time performance that can run faster than the typical LiDAR frame rate. The implementation of our method is released as open source at: https://github.com/BIT-MJY/CVTNet.
研究动机与目标
- 为解决现有基于激光雷达的场景识别(LPR)方法在使用单视图或非优化点云表示时的局限性。
- 通过新型变换器架构建模多层 RIVs 与 BEVs 之间的潜在对齐,挖掘其互补信息。
- 开发一种对偏航角不变的描述符,确保在显著视角变化(包括相反行驶方向)下仍具备鲁棒的场景识别能力。
- 实现适合在线自动驾驶应用的实时推理性能。
提出的方法
- 将 3D 激光雷达点云投影为多层 RIVs 和 BEVs,以捕捉不同深度和高度的空间与距离信息。
- 采用一种新型的跨视角变换器网络(CVTNet),在每个视图(RIV 与 BEV)内部应用内部注意力机制,以提取视图内相关性。
- 在对齐后的 RIV 与 BEV 特征之间应用跨注意力机制,以建模跨视图依赖关系并增强特征判别力。
- 通过可学习的分类标记(class token),端到端地为每个激光雷达扫描生成单一的全局、对偏航角不变的描述符。
- 通过利用 RIV 与 BEV 投影之间的几何对应关系,使网络架构严格具备偏航旋转不变性。
- 通过 FAISS 实现高效检索,基于当前查询扫描与预构建数据库之间的描述符匹配完成场景识别。
实验结果
研究问题
- RQ1通过基于变换器的架构融合多层 RIVs 与 BEVs,能否提升激光雷达场景识别的特征表示?
- RQ2所提出的跨视角变换器在大视角变化下实现对偏航角不变性的有效性如何?
- RQ3与单通道表示相比,使用多层输入是否能增强特征判别力?
- RQ4所提出方法能否实现适合在线自动驾驶系统部署的实时推理性能?
- RQ5在多样化的数据集上,该方法与最先进 LPR 方法相比,在精度与鲁棒性方面表现如何?
主要发现
- CVTNet 在 NCLT、KITTI 和自建数据集上均达到最先进性能,在自建数据集上使用多层输入时,平均 Recall@1 达到 0.907。
- 该方法表现出强大的偏航角不变性,在所有 30° 偏航旋转步长下均保持高性能(Recall@1 > 0.85),优于 MinkLoc3D 和 PointNetVLAD,后两者在旋转增大时性能显著下降。
- CVTNet 推理速度达 29.85 Hz(单次推理耗时 33.50 ms),超过典型 10 Hz 的激光雷达帧率,适用于实时部署。
- 消融实验表明,多层输入相比单通道输入可提升性能,在自建数据集上 Recall@1 提升 0.041。
- 跨注意力模块对性能增益的贡献大于内部注意力模块,表明跨视图相关性对鲁棒描述符学习至关重要。
- 模型仅包含 2138 万个参数,表明其内存消耗低,适合嵌入式设备部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。