Skip to main content
QUICK REVIEW

[论文解读] Image-based localization using LSTMs for structured feature correlation

Florian Walch, Caner Hazırbaş|arXiv (Cornell University)|Nov 23, 2016
Robotics and Sensor-Based Localization参考文献 57被引用 12
一句话总结

该论文提出一种基于CNN+LSTM的图像级相机位姿回归架构,相较于先前的深度学习方法,定位精度提升了32–37%。通过以结构化方式应用LSTM进行降维,模型捕捉到有意义的特征相关性,从而在纹理缺失和重复性高的室内场景中表现出鲁棒性,而SIFT-based方法在此类场景中会失效。

ABSTRACT

In this work we propose a new CNN+LSTM architecture for camera pose regression for indoor and outdoor scenes. CNNs allow us to learn suitable feature representations for localization that are robust against motion blur and illumination changes. We make use of LSTM units on the CNN output, which play the role of a structured dimensionality reduction on the feature vector, leading to drastic improvements in localization performance. We provide extensive quantitative comparison of CNN-based and SIFT-based localization methods, showing the weaknesses and strengths of each. Furthermore, we present a new large-scale indoor dataset with accurate ground truth from a laser scanner. Experimental results on both indoor and outdoor public datasets show our method outperforms existing deep architectures, and can localize images in hard conditions, e.g., in the presence of mostly textureless surfaces, where classic SIFT-based methods fail.

研究动机与目标

  • 解决基于CNN的位姿回归方法的局限性,特别是由于高维全连接层导致的过拟合问题。
  • 与传统的SIFT-based方法相比,提升对运动模糊和光照变化的鲁棒性。
  • 证明基于深度学习的定位方法可在具有重复结构和弱纹理的挑战性室内环境中成功运行。
  • 对最先进的SIFT-based方法与CNN-based方法在定位性能上进行全面的定量比较。
  • 引入一个新的大规模室内数据集(TUM-LSI),其包含通过激光扫描获得的精确真值,用于评估具有挑战性的定位场景。

提出的方法

  • 使用卷积神经网络(CNN)从输入图像中提取鲁棒的高层特征表示,提升对运动模糊和光照变化的鲁棒性。
  • 将长短期记忆(LSTM)单元应用于CNN全连接层的输出,以实现结构化的降维,并建模时间维度或特征维度的相关性。
  • 利用LSTM学习特征向量中长程依赖关系的能力,增强网络的泛化能力并避免过拟合。
  • 通过监督学习在图像到位姿对上端到端训练CNN+LSTM架构,直接进行6-DoF相机位姿回归。
  • 采用多阶段训练策略:先在ImageNet上预训练CNN,然后使用位姿监督微调整个网络。
  • 应用数据增强和Dropout进一步正则化模型,提升泛化能力。

实验结果

研究问题

  • RQ1基于LSTM的架构是否能够超越现有端到端回归模型,提升基于CNN的图像级定位性能?
  • RQ2在准确性和鲁棒性方面,CNN+LSTM方法与最先进的SIFT-based定位方法相比有何定量差异?
  • RQ3在SIFT-based方法完全失效的、具有重复结构和弱纹理的大规模室内环境中,基于深度学习的定位方法是否能够成功?
  • RQ4通过LSTM实现的结构化特征相关性对减少过拟合并提升位姿回归中的泛化能力有何影响?
  • RQ5在传统SfM和特征匹配流程失效的场景中,基于CNN的方法在多大程度上能够实现可靠的定位?

主要发现

  • 所提出的CNN+LSTM模型相较于先前基于CNN的方法(如PoseNet)在标准基准数据集上将定位精度提升了32–37%。
  • 在新的TUM-LSI数据集上,该方法实现了1.31 m的中位数定位误差和2.79°的方位角误差,显著优于PoseNet的1.87 m和6.14°。
  • 由于缺乏纹理和重复结构,SIFT-based方法(包括Active Search)在TUM-LSI数据集上完全失效,导致SfM重建结果错误。
  • TUM-LSI数据集覆盖5,575 m²,包含1,095张高分辨率图像,揭示了COLMAP和VisualSFM等SfM流程在纹理缺失、重复性环境中无法重建准确的三维模型。
  • LSTM层实现了结构化的特征相关性,减少了过拟合并增强了泛化能力,尤其在具有挑战性的视觉条件下表现更优。
  • 本工作首次证明,基于CNN的定位方法可在真实世界中弱纹理和重复结构的室内场景中成功运行,而SIFT-based方法则完全失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。