[论文解读] Geometry-Aware Learning of Maps for Camera Localization
该论文提出 MapNet,一种深度神经网络,通过融合视觉、GPS 和视觉里程计输入,学习一种数据驱动的、几何感知的地图表示,用于相机定位。通过在训练和推理过程中将相对位姿、平移和旋转等几何约束融入损失函数,MapNet 在先前基于深度神经网络的方法基础上显著提升了定位精度,且通过使用未标记视频序列进行自监督微调,进一步提高了性能。
Maps are a key component in image-based camera localization and visual SLAM systems: they are used to establish geometric constraints between images, correct drift in relative pose estimation, and relocalize cameras after lost tracking. The exact definitions of maps, however, are often application-specific and hand-crafted for different scenarios (e.g. 3D landmarks, lines, planes, bags of visual words). We propose to represent maps as a deep neural net called MapNet, which enables learning a data-driven map representation. Unlike prior work on learning maps, MapNet exploits cheap and ubiquitous sensory inputs like visual odometry and GPS in addition to images and fuses them together for camera localization. Geometric constraints expressed by these inputs, which have traditionally been used in bundle adjustment or pose-graph optimization, are formulated as loss terms in MapNet training and also used during inference. In addition to directly improving localization accuracy, this allows us to update the MapNet (i.e., maps) in a self-supervised manner using additional unlabeled video sequences from the scene. We also propose a novel parameterization for camera rotation which is better suited for deep-learning based camera pose regression. Experimental results on both the indoor 7-Scenes dataset and the outdoor Oxford RobotCar dataset show significant performance improvement over prior work. The MapNet project webpage is https://goo.gl/mRB3Au.
研究动机与目标
- 解决传统手工设计地图表示在视觉 SLAM 和基于图像定位中灵活性差、应用特定性的问题。
- 实现端到端学习一种通用的地图表示,可适应多样化的环境和传感器输入。
- 通过将几何约束(如相对位姿、平移、旋转)直接嵌入深度学习训练过程,提升相机定位精度。
- 支持使用未标记视频序列进行连续的、自监督的地图更新,无需绝对位姿监督。
- 提出一种基于单位四元数对数的新旋转参数化方法,以提升基于深度学习的位姿回归性能。
提出的方法
- 将地图表示为一个深度神经网络(MapNet),以图像为输入,预测相机位姿,地图信息隐式编码于网络权重中。
- 在训练过程中,将相对位姿(来自视觉里程计)、GPS 平移和 IMU 旋转等几何约束形式化为可微分的损失项。
- 提出一种基于单位四元数对数的新旋转参数化方法,提升了深度网络中优化的稳定性和回归精度。
- 通过 MapNet+ 实现自监督适应,利用未标记视频序列中的几何约束对网络权重进行微调,无需真实位姿监督。
- 在滑动窗口中使用位姿图优化(PGO)融合 MapNet 预测与视觉里程计,结合局部平滑性与全局一致性,形成 MapNet+PGO。
- 使用注意力图可视化并验证 MapNet 关注的是具有几何意义的图像区域,从而提升时间一致性。
实验结果
研究问题
- RQ1是否可以训练一个深度神经网络,以学习一种跨多样化环境的通用性、数据驱动的地图表示?
- RQ2将辅助传感器(如视觉里程计、GPS、IMU)提供的几何约束(如相对位姿、平移、旋转)融入损失函数,是否能提升相机定位精度?
- RQ3是否可以使用未标记视频序列对 MapNet 实现连续的自监督更新,以提升鲁棒性和适应性?
- RQ4所提出的对数四元数参数化方法是否在基于深度学习的相机位姿回归中优于标准表示?
- RQ5通过 PGO 融合 MapNet 预测与视觉里程计,是否能进一步减少长序列中的漂移并提升定位精度?
主要发现
- MapNet 在室内 7-Scenes 和室外 Oxford RobotCar 数据集上显著优于先前基于深度神经网络的方法(如 PoseNet),实现了更低的平移和旋转误差。
- 将几何约束融入训练损失,通过利用视觉里程计、GPS 和 IMU 提供的相对位姿、平移和旋转信息,有效降低了定位误差。
- MapNet+ 支持使用未标记视频序列进行自监督适应,使模型在无需真实位姿的情况下持续改进。
- MapNet+PGO 通过在滑动窗口中使用 PGO 融合 MapNet 预测与视觉里程计,实现了最佳性能,有效减少了长序列中的漂移并提升了精度。
- 在 7-Scenes 数据集上的定量消融实验表明,所提出的对数四元数参数化方法显著提升了 PoseNet 和 MapNet 的性能。
- MapNet+PGO 产生的虚假预测(通常由过曝或动态区域引起)可通过简单的时序中值滤波有效去除,如图 12 所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。