Skip to main content
QUICK REVIEW

[论文解读] Image-based Localization using Hourglass Networks

Iaroslav Melekhov, Juha Ylioinas|arXiv (Cornell University)|Mar 23, 2017
Advanced Vision and Imaging被引用 12
一句话总结

本文提出一种用于单图像相机重定位的沙漏形编码器-解码器卷积神经网络,通过跳跃连接和转置卷积层增强特征恢复能力。该方法在7-Scenes数据集上实现了最先进性能,与PoseNet相比,平均平移误差降低52.27%,方向误差降低8.47%,甚至优于使用多帧序列的方法。

ABSTRACT

In this paper, we propose an encoder-decoder convolutional neural network (CNN) architecture for estimating camera pose (orientation and location) from a single RGB-image. The architecture has a hourglass shape consisting of a chain of convolution and up-convolution layers followed by a regression part. The up-convolution layers are introduced to preserve the fine-grained information of the input image. Following the common practice, we train our model in end-to-end manner utilizing transfer learning from large scale classification data. The experiments demonstrate the performance of the approach on data exhibiting different lighting conditions, reflections, and motion blur. The results indicate a clear improvement over the previous state-of-the-art even when compared to methods that utilize sequence of test frames instead of a single frame.

研究动机与目标

  • 通过用深度学习替代关键点匹配,解决基于特征的方法在无纹理、重复性或遮挡场景下的局限性。
  • 在运动模糊、反光和光照变化等挑战性视觉条件下,提升相机位姿估计的准确性。
  • 利用编码器-解码器架构与跳跃连接,在保持全局上下文的同时保留细粒度细节,实现鲁棒回归。
  • 通过大规模分类数据集的迁移学习实现端到端训练,提升在有限重定位数据上的泛化能力。
  • 证明单图像方法可在精度上超越多帧方法,挑战时间序列对高性能的必要性假设。

提出的方法

  • 设计对称的沙漏形卷积神经网络,编码器通过卷积层下采样,解码器通过转置卷积层上采样,以恢复空间分辨率。
  • 在编码器的早期残差块与解码器对应的转置卷积层之间引入跳跃连接,以保留细粒度特征。
  • 使用包含三层全连接层的回归头,从最终特征图预测6-DoF相机位姿(三维位置和三维方向)。
  • 在7-Scenes数据集上使用均方误差损失函数并进行尺度归一化,端到端训练网络,最小化位姿误差。
  • 通过随机裁剪(224×224)进行数据增强,评估时使用中心裁剪,采用Adam优化器并固定超参数(β₁=0.9, β₂=0.99, 权重衰减=10⁻⁵)。
  • 利用ImageNet预训练模型进行迁移学习,以提升在重定位任务中的收敛速度与性能。

实验结果

研究问题

  • RQ1与标准回归网络相比,带有跳跃连接的编码器-解码器卷积神经网络架构是否能提升单图像相机重定位的准确性?
  • RQ2通过转置卷积上采样保留细粒度视觉细节,是否能增强在纹理丢失或运动模糊场景下的位姿估计性能?
  • RQ3单图像卷积神经网络方法在多帧方法(如VidLoc)使用时间序列的背景下,能在多大程度上实现性能超越?
  • RQ4在不同光照和场景条件下,所提出的沙漏架构与PoseNet相比,在鲁棒性方面表现如何?
  • RQ5来自早期残差层的跳跃连接是否能显著提升相机重定位任务中回归的特征表示能力?

主要发现

  • 在7-Scenes数据集上,与PoseNet相比,HourglassSum-Pose将平均平移误差降低52.27%,方向误差降低8.47%。
  • HourglassSum-Pose在所有场景中的方向精度均优于LSTM-Pose,证明沙漏结构在位姿回归中的有效性。
  • 与多帧基线方法VidLoc相比,该方法将平均平移误差降低1–2 cm,证明单图像方法可超越基于序列的方法。
  • 在'Chess'场景中,超过60%的HourglassSum-Pose预测结果与真实值相差小于20 cm,而PoseNet仅5%,凸显其在重复结构中的鲁棒性。
  • 在'Veranda'等具有高重复性和模糊性的挑战性场景中,模型仍保持优异性能,表明其泛化能力显著提升。
  • 累积直方图分析表明,两种沙漏变体在所有场景中均持续优于PoseNet,翻译精度提升1.5至2.3倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。