Skip to main content
QUICK REVIEW

[论文解读] Local Supports Global: Deep Camera Relocalization with Sequence Enhancement

Fei Xue, Xin Wang|arXiv (Cornell University)|Aug 6, 2019
Robotics and Sensor-Based Localization参考文献 34被引用 10
一句话总结

本文提出了一种用于相机重定位的深度学习框架,通过利用序列图像数据,结合视觉里程计(VO)实现局部运动一致性以及通过共可见性在循环隐藏状态中增强特征表示,从而提高位姿估计的准确性。该方法在7-Scenes和Oxford RobotCar数据集上优于最先进方法,尤其在纹理缺失、过曝和重复外观等挑战性条件下表现更优,通过融合VO导出的运动约束,联合优化位姿图中的全局位姿。

ABSTRACT

We propose to leverage the local information in image sequences to support global camera relocalization. In contrast to previous methods that regress global poses from single images, we exploit the spatial-temporal consistency in sequential images to alleviate uncertainty due to visual ambiguities by incorporating a visual odometry (VO) component. Specifically, we introduce two effective steps called content-augmented pose estimation and motion-based refinement. The content-augmentation step focuses on alleviating the uncertainty of pose estimation by augmenting the observation based on the co-visibility in local maps built by the VO stream. Besides, the motion-based refinement is formulated as a pose graph, where the camera poses are further optimized by adopting relative poses provided by the VO component as additional motion constraints. Thus, the global consistency can be guaranteed. Experiments on the public indoor 7-Scenes and outdoor Oxford RobotCar benchmark datasets demonstrate that benefited from local information inherent in the sequence, our approach outperforms state-of-the-art methods, especially in some challenging cases, e.g., insufficient texture, highly repetitive textures, similar appearances, and over-exposure.

研究动机与目标

  • 为解决由于重复纹理和低纹理等视觉模糊性导致的基于单张图像的相机重定位的不稳定性与模糊性问题。
  • 通过利用图像序列中的时空一致性来改善全局位姿估计。
  • 将视觉里程计(VO)作为运动约束的来源,以增强位姿图优化。
  • 在过曝、动态物体和相似外观等挑战性场景中减少位姿估计误差。
  • 通过联合学习序列图像中的重定位与VO,实现端到端训练与推理。

提出的方法

  • 使用基于卷积LSTM的VO子网络,从序列图像特征中估计连续帧之间的相对位姿。
  • 将循环单元的隐藏状态用作局部地图,以保留历史视觉内容,实现基于共可见性的特征增强。
  • 应用软注意力机制,利用局部地图中的共可见区域对原始特征进行增强,从而改善全局位姿回归的特征表示。
  • 构建一个位姿图,其中全局位姿为节点,VO输出的相对位姿为边,实现在训练和推理过程中的一致性优化。
  • 对位姿估计器与VO分支进行端到端的联合训练,并通过基于图的优化进行细化。
  • 使用内容增强模块在位姿回归前提升特征质量,并通过位姿图实现基于运动的特征细化,以保证时序一致性。

实验结果

研究问题

  • RQ1图像序列中的局部时空一致性是否能提升基于单张图像的相机重定位的鲁棒性?
  • RQ2在模糊视觉环境中,将视觉里程计作为运动约束在多大程度上能提升全局位姿估计性能?
  • RQ3从局部地图中基于共可见性的特征增强在多大程度上能降低位姿预测的不确定性?
  • RQ4在过曝和重复纹理等具有挑战性的现实场景中,该方法与最先进方法相比表现如何?
  • RQ5统一的端到端框架是否能联合优化重定位与视觉里程计,从而实现更好的泛化能力?

主要发现

  • 在Oxford RobotCar数据集中,所提方法的平均平移误差为25.84m,旋转误差为4.99°,优于PoseNet(77.85m,22.56°)和MapNet(29.83m,8.68°)。
  • 在FULL1和FULL2序列(9.5km和11.2km)中,该方法保持了较低的误差增长,而MapNet的误差随场景规模急剧上升。
  • 与PoseNet和MapNet相比,该方法在长序列中显著减少了异常值,尤其是在外观相似区域。
  • 位姿图细化步骤显著提升了稳定性与准确性,尤其在过曝和动态物体等挑战性条件下表现突出。
  • 特征可视化显示,该模型在模糊区域学习到了比PoseNet和MapNet更具区分性的注意力图。
  • 该方法在处理低纹理、重复图案和光照变化等视觉模糊性方面表现出更优的鲁棒性,优于先前方法在这些场景下的表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。