Skip to main content
QUICK REVIEW

[论文解读] Rethinking Visual Geo-localization for Large-Scale Applications

Gabriele Berton, Carlo Masone|arXiv (Cornell University)|Apr 5, 2022
Advanced Image and Video Retrieval Techniques被引用 13
一句话总结

本文提出 CosPlace,一种用于视觉地理定位的新型训练方法,用轻量级的分类方法替代计算成本高昂的对比学习,使在大规模数据集(如 SF-XL)上高效训练成为可能。CosPlace 在使用 8 倍小的描述符和 80% 更少的 GPU 显存的情况下实现了最先进性能,显著提升了城市规模应用中的可扩展性和泛化能力。

ABSTRACT

Visual Geo-localization (VG) is the task of estimating the position where a given photo was taken by comparing it with a large database of images of known locations. To investigate how existing techniques would perform on a real-world city-wide VG application, we build San Francisco eXtra Large, a new dataset covering a whole city and providing a wide range of challenging cases, with a size 30x bigger than the previous largest dataset for visual geo-localization. We find that current methods fail to scale to such large datasets, therefore we design a new highly scalable training technique, called CosPlace, which casts the training as a classification problem avoiding the expensive mining needed by the commonly used contrastive learning. We achieve state-of-the-art performance on a wide range of datasets and find that CosPlace is robust to heavy domain changes. Moreover, we show that, compared to the previous state-of-the-art, CosPlace requires roughly 80% less GPU memory at train time, and it achieves better results with 8x smaller descriptors, paving the way for city-wide real-world visual geo-localization. Dataset, code and trained models are available for research purposes at https://github.com/gmberton/CosPlace.

研究动机与目标

  • 解决真实世界视觉地理定位应用中代表性大规模数据集的缺乏问题。
  • 克服当前对比学习方法在大规模训练数据库中依赖昂贵负样本挖掘所导致的可扩展性限制。
  • 开发一种训练范式,使大规模城市级图像集合在训练和推理中都能被有效利用。
  • 实现在极低计算资源下高效、高性能的视觉地理定位,并在不同领域间具备强泛化能力。

提出的方法

  • 提出 CosPlace,一种将视觉地理定位建模为基于地理位置和朝向分组的多分类问题的训练方法。
  • 基于空间单元和朝向区间定义类别,构建结构化、可区分的训练标签,无需负样本挖掘。
  • 通过在分组类别上使用交叉熵损失作为对比损失的代理,实现端到端训练与标准优化。
  • 利用主干网络(如 ResNet)结合全局平均池化,生成紧凑且具有判别力的描述符。
  • 在推理阶段使用余弦相似度进行检索,利用学习到的描述符将查询图像与最近似的数据库图像匹配。
  • 在新提出的旧金山超大规模(San Francisco eXtra Large, SF-XL)数据集中进行训练,该数据集覆盖整个城市,包含密集且多源域的图像集合。

实验结果

研究问题

  • RQ1在无需昂贵负样本挖掘的前提下,基于分类的训练方法是否能在大规模视觉地理定位任务中超越对比学习?
  • RQ2当使用像 SF-XL 这样大规模的城市级数据集时,CosPlace 模型的性能扩展能力如何?
  • RQ3CosPlace 在其他数据集和领域中的泛化能力如何,尤其是在领域分布发生变化时?
  • RQ4与现有方法相比,CosPlace 在描述符大小、推理速度和准确率之间的权衡如何?
  • RQ5在所提出的框架中,朝向标签的引入如何影响性能和训练效率?

主要发现

  • CosPlace 在多个基准测试中达到最先进性能,例如在使用 512-D 描述符时,Pitts250k 数据集上的召回率@1 达到 90.9%。
  • 512-D 的 CosPlace 模型在性能上超越了之前的最先进方法(SFRS),同时使用了 8 倍小的描述符,并且训练时所需 GPU 显存减少了 80%。
  • 该方法在跨领域场景中表现出稳健的泛化能力,在圣卢西亚数据集上达到 98.8% 的召回率@1,在 MSLS 数据集上达到 81.8%,即使仅在 SF-XL 上进行训练。
  • 与 4096-D 的 SFRS 相比,CosPlace 在使用 512-D 描述符时实现 8 倍的推理加速;与 32k-D 的 NetVLAD 相比,推理速度提升达 64 倍。
  • 在 CosPlace 中引入基于朝向的分组显著提升了性能,消融实验表明,当移除朝向标签后,召回率@1 下降约 10%。
  • CosPlace 在多种主干网络(包括 ResNets 和 Transformers)上均表现优异,且无需架构修改即可超越基于 VGG-16 的模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。