Skip to main content
QUICK REVIEW

[论文解读] Data-Efficient Large Scale Place Recognition With Graded Similarity Supervision

Maria Leyva-Vallina, Nicola Strisciuglio|arXiv (Cornell University)|Mar 11, 2021
Advanced Image and Video Retrieval Techniques参考文献 59被引用 12
一句话总结

本文提出了一种广义对比损失(GCL)函数,该函数使用连续的分级相似度标签而非二值相似度标签来训练孪生卷积神经网络(CNN)进行视觉位置识别。通过利用GPS、姿态和三维重建技术对MSLS、TB-Places和7Scenes数据集进行重新标注,生成连续相似度分数,作者表明,使用GCL训练的模型优于二值相似度对比方法以及SOTA方法(如NetVLAD和Patch-NetVLAD),在MSLS数据集上实现了76.2%的top-5召回率,并消除了对复杂难样本挖掘的依赖。

ABSTRACT

Visual place recognition (VPR) is a fundamental task of computer vision for visual localization. Existing methods are trained using image pairs that either depict the same place or not. Such a binary indication does not consider continuous relations of similarity between images of the same place taken from different positions, determined by the continuous nature of camera pose. The binary similarity induces a noisy supervision signal into the training of VPR methods, which stall in local minima and require expensive hard mining algorithms to guarantee convergence. Motivated by the fact that two images of the same place only partially share visual cues due to camera pose differences, we deploy an automatic re-annotation strategy to re-label VPR datasets. We compute graded similarity labels for image pairs based on available localization metadata. Furthermore, we propose a new Generalized Contrastive Loss (GCL) that uses graded similarity labels for training contrastive networks. We demonstrate that the use of the new labels and GCL allow to dispense from hard-pair mining, and to train image descriptors that perform better in VPR by nearest neighbor search, obtaining superior or comparable results than methods that require expensive hard-pair mining and re-ranking techniques.

研究动机与目标

  • 为解决视觉位置识别中二值相似度标注的局限性,该方法无法捕捉图像之间的部分或连续相似度。
  • 开发一种广义对比损失函数,利用连续相似度分数以改善嵌入空间的学习。
  • 利用几何与三维重建数据,自动对现有数据集(MSLS、TB-Places、7Scenes)进行分级相似度标签的重新标注。
  • 使用GCL训练孪生卷积神经网络,使其在无需复杂挖掘策略的情况下,能在多样化基准上实现良好泛化。
  • 证明连续监督与GCL可实现比二值对比学习更高的性能和更高效的训练。

提出的方法

  • 提出一种广义对比损失(GCL)函数,根据图像相似度的程度按比例惩罚嵌入距离,而非将相似度视为二值。
  • 设计三种自动标注策略:弱2D视场重叠(基于GPS与罗盘)、强2D视场重叠(基于6DOF姿态)和3D视场重叠(基于三维重建)。
  • 将GCL函数应用于训练孪生网络,采用全卷积主干网络,并结合GeM或平均池化层生成全局嵌入。
  • 通过主成分分析(PCA)白化与降维处理,提升学习到的描述符的泛化能力与性能。
  • 采用简单的批量平衡策略——每批中正样本对与负样本对数量相等——避免了难样本挖掘。
  • 在MSLS、Pittsburgh30k、Tokyo24/7、RobotCar Seasons v2和Extended CMU Seasons等数据集上部署模型以进行评估。

实验结果

研究问题

  • RQ1与二值监督相比,连续相似度监督是否能提升孪生网络在视觉位置识别中的性能?
  • RQ2所提出的广义对比损失(GCL)函数是否能在无需难样本挖掘的情况下,实现对多样化数据集的更好泛化?
  • RQ3基于几何的自动方法在大规模数据集中估计图像对之间分级相似度的效率如何?
  • RQ4PCA白化在多大程度上能提升学习到的图像嵌入的性能与泛化能力?
  • RQ5基于GCL的模型是否能在top-5召回率与训练效率方面超越SOTA方法(如NetVLAD与Patch-NetVLAD)?

主要发现

  • ResNeXt-GeM-GCL模型在MSLS验证集上实现了76.2%的top-5召回率,优于NetVLAD(58.8%)、NetVLAD-SARE(44.3%)、AP-GeM(44.5%)和Patch-NetVLAD(57.6%)。
  • GCL模型在MSLS、TB-Places和7Scenes上的top-5召回率最高比其二值对比损失对应模型高出18%。
  • 在MSLS上使用GCL训练仅需1个周期,而NetVLAD-16与NetVLAD-64分别需要22和7个周期,显著减少了训练时间。
  • PCA白化在Tokyo24/7上使性能最高提升28.2%,在MSLS验证集上提升达12.8%,即使将描述符维度降低至128或256仍有效。
  • ResNeXt-GeM-GCL模型在256维下保持了强劲性能,而VGG16-GeM-GCL在256维时达到top-5召回率峰值。
  • 模型在Pittsburgh30k、Tokyo24/7、RobotCar Seasons v2和Extended CMU Seasons上均表现出良好泛化能力,证明其对视角、光照与季节变化具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。