Skip to main content
QUICK REVIEW

[论文解读] Panorama to panorama matching for location recognition

Ahmet İşcen, Giorgos Tolias|arXiv (Cornell University)|Apr 21, 2017
Advanced Image and Video Retrieval Techniques参考文献 24被引用 4
一句话总结

该论文提出了一种新颖的全景图到全景图匹配方法,用于定位识别,通过在查询端和数据库端均使用求和向量和伪逆向量聚合多个全景视图的特征。该方法仅使用四张查询图像就在匹兹堡数据集上实现了接近完美的召回率(98% recall@1),显著优于先前的方法,同时通过高效的特征聚合避免了3D重建或监督训练,从而降低了内存和计算成本。

ABSTRACT

Location recognition is commonly treated as visual instance retrieval on "street view" imagery. The dataset items and queries are panoramic views, i.e. groups of images taken at a single location. This work introduces a novel panorama-to-panorama matching process, either by aggregating features of individual images in a group or by explicitly constructing a larger panorama. In either case, multiple views are used as queries. We reach near perfect location recognition on a standard benchmark with only four query views.

研究动机与目标

  • 通过利用同一位置的多个视图,提升全景街景图像中的定位识别性能。
  • 通过使用自然的、基于位置的图像分组,消除对昂贵3D重建或监督训练的需求。
  • 通过在查询端和数据库端均聚合特征,提升检索效率和鲁棒性。
  • 评估在特征空间中隐式与显式全景图构建方法在视觉实例检索中的有效性。

提出的方法

  • 使用求和向量或伪逆(pinv向量)方法,将同一全景组中各张图像的特征聚合为单一联合表示。
  • 在聚合前,使用NetVLAD卷积神经网络描述符从每张图像中提取全局特征。
  • 使用Moore-Penrose伪逆构造理论上优化的pinv向量,即使在特征向量差异较大或随机时也能表现良好。
  • 同时采用隐式(特征空间)和显式(图像拼接)全景图构建方法进行对比。
  • 通过计算查询端和数据库端联合表示之间的交叉相似度(使用点积或加权相似度矩阵)完成检索。
  • 通过仅从一个位置采样部分图像的方式,评估在稀疏查询条件下的性能。

实验结果

研究问题

  • RQ1在查询端和数据库端均对多个全景视图进行联合表示,能否显著提升定位识别的准确性?
  • RQ2在特征空间中进行特征聚合(无需图像拼接)是否在检索性能上优于显式全景图构建方法?
  • RQ3当仅有少量查询图像(例如四张)时,该方法的性能如何?
  • RQ4无监督的、基于位置的图像分组能否在无需3D重建或微调的情况下实现最先进性能?
  • RQ5与从完整全景图中提取NetVLAD描述符相比,pinv向量聚合方法的性能如何?

主要发现

  • 所提出的pan2pan方法仅使用四张查询图像就在匹兹堡数据集上实现了98%的recall@1,证明了近乎完美的定位识别能力。
  • 与基线的逐图像检索相比,该方法将内存使用量降低了24倍,搜索速度提升了24²倍。
  • pinv向量聚合方法在性能上优于求和向量和基于NetVLAD的方法,尤其在仅提供两张或四张图像的稀疏查询场景中表现更优。
  • 即使仅从一个位置随机采样四张图像,该方法仍能达到99%的recall@5,表明其对不完整全景图具有强鲁棒性。
  • 该方法显著优于基于扩散的查询扩展方法(96.5% vs. 91.9% recall@1),表明在该场景下联合表示比迭代式查询优化更有效。
  • 结果表明,将单个视图聚合为pinv向量,其效果优于从拼接后的全景图中提取单一NetVLAD描述符。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。