Skip to main content
QUICK REVIEW

[论文解读] CMRNet++: Map and camera agnostic monocular visual localization in lidar maps

Daniele Cattaneo, Domenico G. Sorrenti|arXiv (Cornell University)|Apr 1, 2020
Robotics and Sensor-Based Localization被引用 2
一句话总结

CMRNet++ 提出了一种与相机和地图无关的单目视觉定位方法,将度量推理与深度学习解耦,从而在无需微调的情况下实现在未见过环境中的精确定位。通过结合学习到的特征提取与几何标定,该方法在 KITTI、Argoverse 和 Lyft5 数据集上均实现了最先进性能,展示了在不同相机和场景下的强大泛化能力。

ABSTRACT

Localization is a critically essential and crucial enabler of autonomous robots. While deep learning has made significant strides in many computer vision tasks, it is still yet to make a sizeable impact on improving capabilities of metric visual localization. One of the major hindrances has been the inability of existing Convolutional Neural Network (CNN)-based pose regression methods to generalize to previously unseen places. Our recently introduced CMRNet effectively addresses this limitation by enabling map independent monocular localization in LiDAR-maps. In this paper, we now take it a step further by introducing CMRNet++, which is a significantly more robust model that not only generalizes to new places effectively, but is also independent of the camera parameters. We enable this capability by combining deep learning with geometric techniques, and by moving the metric reasoning outside the learning process. In this way, the weights of the network are not tied to a specific camera. Extensive evaluations of CMRNet++ on three challenging autonomous driving datasets, i.e., KITTI, Argoverse, and Lyft5, show that CMRNet++ outperforms CMRNet as well as other baselines by a large margin. More importantly, for the first-time, we demonstrate the ability of a deep learning approach to accurately localize without any retraining or fine-tuning in a completely new environment and independent of the camera parameters.

研究动机与目标

  • 解决基于 CNN 的单目视觉定位方法在之前未见过环境中的泛化能力不足问题。
  • 克服现有深度学习模型对特定相机参数和 LiDAR 地图结构的依赖。
  • 实现在新环境中的零样本定位,且无需任何微调或再训练。
  • 通过将度量推理与神经网络权重解耦,实现与相机无关的推理。
  • 在具有不同相机配置和地图类型的多样化自动驾驶数据集上展示稳健性能。

提出的方法

  • 提出两阶段流程:首先使用深度神经网络进行图像特征提取,随后通过几何推理进行位姿估计。
  • 通过在特征提取后应用几何标定,将度量推理与网络权重解耦,确保与相机无关的推理。
  • 使用对相机内参不变的可学习特征编码器,并在多种相机配置上进行训练。
  • 利用 LiDDR 地图施加几何约束,从图像特征中估计绝对相机位姿,而无需依赖地图特异性特征。
  • 在训练期间利用 LiDAR 地图进行度量监督,同时在推理中保持与相机无关性。
  • 应用可微的几何层,将图像特征映射到地图中的 3D 坐标,实现具有几何一致性的端到端训练。

实验结果

研究问题

  • RQ1基于深度学习的单目定位系统是否能在完全未见过的环境中实现无需任何微调的精确定位?
  • RQ2学习到的视觉定位模型在保持高精度的前提下,能在多大程度上泛化到不同相机参数?
  • RQ3将度量推理与神经网络权重解耦在提升泛化能力和相机独立性方面有多有效?
  • RQ4在真实自动驾驶场景中,结合深度学习与几何推理是否优于纯学习或纯几何方法?
  • RQ5该模型是否能在具有不同地图结构和相机配置的多样化数据集上保持高性能?

主要发现

  • CMRNet++ 在 KITTI、Argoverse 和 Lyft5 数据集上均达到最先进性能,优于 CMRNet 和其他基线方法。
  • 该模型实现了在新环境中的零样本定位,且无需任何微调或再训练,这是基于深度学习的视觉定位方法中的首次。
  • CMRNet++ 实现了与相机无关的性能,在不同相机内参下均保持高精度,无需模型适配。
  • 将度量推理与网络权重解耦,实现了稳健的泛化能力,同时保持了高定位精度。
  • 大量评估结果证实,CMRNet++ 在具有不同地图和相机特性的多样化真实世界自动驾驶数据集上具有有效的泛化能力。
  • 与 CMRNet 相比,该方法在具有挑战性和未见过的环境中显著提升了定位精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。