Skip to main content
QUICK REVIEW

[论文解读] Towards CNN Map Compression for camera relocalisation

Luis Contreras, Walterio Mayol‐Cuevas|arXiv (Cornell University)|Mar 2, 2017
Advanced Vision and Imaging参考文献 30被引用 3
一句话总结

本文提出一种基于紧凑卷积神经网络(CNN)的地图表示方法,用于相机重定位,通过训练一个小型、固定尺寸的CNN(CNN-F)并逐步增加训练轨迹数量,实现地图压缩。尽管模型架构极为简单,其重定位精度仍可与更大的网络(如PoseNet)相媲美(平均误差0.59米),表明在模型大小不变的前提下,性能随训练数据增多而持续提升。

ABSTRACT

This paper presents a study on the use of Convolutional Neural Networks for camera relocalisation and its application to map compression. We follow state of the art visual relocalisation results and evaluate response to different data inputs -- namely, depth, grayscale, RGB, spatial position and combinations of these. We use a CNN map representation and introduce the notion of CNN map compression by using a smaller CNN architecture. We evaluate our proposal in a series of publicly available datasets. This formulation allows us to improve relocalisation accuracy by increasing the number of training trajectories while maintaining a constant-size CNN.

研究动机与目标

  • 探索用于高效相机重定位地图表示的紧凑CNN架构。
  • 研究不同传感器输入(RGB、深度、空间位置)对重定位精度的影响。
  • 评估增加训练轨迹是否可在不增加模型大小的前提下提升精度。
  • 证明通过保持固定CNN架构并使用新数据重新训练,可实现地图压缩。
  • 将轻量级CNN-F(8层)与更复杂的模型(如PoseNet,23层)进行性能对比。

提出的方法

  • 采用轻量级8层CNN-F架构,包含5个卷积层和3个全连接层,根据输入类型调整输入维度(n)。
  • 采用受PoseNet启发的损失函数,结合L2距离计算平移误差与归一化四元数误差计算方向误差。
  • 处理包括RGB、灰度图、深度图、三维空间位置及其组合在内的输入,经裁剪和缩放后空间分辨率为224×224。
  • 通过从7-Scenes数据集中逐步添加新轨迹,对同一CNN-F模型进行增量训练,仅更新权重而保持架构不变。
  • 使用均方重定位误差(单位:米)作为主要指标,在公开数据集(TUM、7-Scenes)上评估性能。
  • 在不同输入模态与PoseNet基线之间进行对比,评估相对性能。

实验结果

研究问题

  • RQ1紧凑CNN(CNN-F)在相机重定位任务中的表现与更大模型(如PoseNet)相比如何?
  • RQ2哪种输入模态(RGB、深度、灰度图、空间位置或其组合)能获得最佳重定位精度?
  • RQ3在不增加模型大小的前提下,能否通过增加训练轨迹数量来提升重定位精度?
  • RQ4通过增量重训练,固定尺寸的CNN在多大程度上能表示日益复杂地图信息?
  • RQ5是否可能通过使用极简CNN架构,在保持高精度的前提下,实现对多样化输入的高效地图压缩?

主要发现

  • 在Red Kitchen序列上,CNN-F模型使用RGB输入时的平均重定位误差为0.589米,与PoseNet报告的0.59米误差相当。
  • RGB输入表现最佳(误差0.589米),优于深度图(1.326米)、灰度图(0.795米)和点云(0.791米)输入。
  • 增加训练轨迹可一致降低重定位误差,且不增加模型大小,表明具有良好的可扩展性与压缩潜力。
  • 即使在训练多个轨迹后,模型性能仍未出现饱和迹象,表明在更多数据下仍有进一步提升空间。
  • 尽管仅包含8层,CNN-F架构的精度与PoseNet相当,证明在不损失性能的前提下可大幅缩减模型尺寸。
  • 通过新轨迹的权重更新,地图表示的大小保持不变(固定架构),而信息内容持续增加,从而实现有效的地图压缩。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。