Skip to main content
QUICK REVIEW

[论文解读] 2nd Place and 2nd Place Solution to Kaggle Landmark Recognition andRetrieval Competition 2019

Kaibing Chen, Cheng Cui|arXiv (Cornell University)|Jun 10, 2019
Advanced Image and Video Retrieval Techniques参考文献 17被引用 6
一句话总结

本论文提出了一种混合检索与识别系统,作为2019年Kaggle地标识别与检索竞赛的第二名解决方案。该方法结合了多个深度卷积神经网络主干网络(ResNet152、ResNet200、SE_ResNeXt152、InceptionV4),采用ArcMargin损失进行全局特征提取,通过主成分分析(PCA)进行降维,并利用局部特征匹配(SURF、Hessian-Affine、SIFT)提升对几何变换的鲁棒性。系统通过查询扩展、数据库增强以及结合识别分数与检索置信度的多阶段重排序,实现了0.37469的私有集GAP得分和0.36365的公开集GAP得分。

ABSTRACT

We present a retrieval based system for landmark retrieval and recognition challenge.There are five parts in retrieval competition system, including feature extraction and matching to get candidates queue; database augmentation and query extension searching; reranking from recognition results and local feature matching. In recognition challenge including: landmark and non-landmark recognition, multiple recognition results voting and reranking using combination of recognition and retrieval results. All of models trained and predicted by PaddlePaddle framework. Using our method, we achieved 2nd place in the Google Landmark Recognition 2019 and 2nd place in the Google Landmark Retrieval 2019 on kaggle. The source code is available at here.

研究动机与目标

  • 开发适用于大规模地标数据集的高精度图像检索与识别系统。
  • 在尺度、旋转和视角变化下提升地标识别的泛化能力与鲁棒性。
  • 针对大规模数据(400万张训练图像,100万张索引图像)提出有效的特征学习与高效搜索方法。
  • 通过全局与局部特征融合、查询扩展和数据库增强,提升检索性能。
  • 在Google地标数据集V2上实现地标识别与检索任务的顶尖性能。

提出的方法

  • 对四个深度卷积神经网络主干网络(ResNet152、ResNet200、SE_ResNeXt152、InceptionV4)进行微调,采用ArcMargin损失以实现更具判别性的全局特征学习。
  • 从平均池化后的第一个全连接层提取图像描述符,随后通过主成分分析(PCA)将维度降低至512。
  • 通过拼接方式融合多个全局描述符,并应用k-NN搜索进行候选检索。
  • 结合SURF、Hessian-Affine和SIFT的局部特征匹配,并利用倒排索引实现高效的最近邻搜索。
  • 通过在第二阶段索引数据上聚类实现查询扩展与数据库增强,以扩大训练与搜索的覆盖范围。
  • 采用多阶段重排序,结合识别置信度、检索分数以及针对频繁出现地标(集合W)的频率相关技巧,以抑制干扰项。

实验结果

研究问题

  • RQ1深度卷积神经网络结合ArcMargin损失在大规模数据集中的地标检索任务中,如何提升全局特征表示能力?
  • RQ2在几何变换下,局部特征匹配(SURF、SIFT、Hessian-Affine)在多大程度上能增强检索鲁棒性?
  • RQ3通过聚类实现的查询扩展与数据库增强,在提升检索覆盖率与准确性方面效果如何?
  • RQ4多模型融合与迭代重排序是否能显著提升在地标基准数据集上的识别与检索性能?
  • RQ5对频繁出现的地标进行基于频率的重排序,对减少误报并提升GAP得分有何影响?

主要发现

  • 该系统在Kaggle 2019年竞赛的地标识别与检索两个赛道中均获得第二名。
  • 在对顶级预测结果应用基于频率的重排序后,最终私有集GAP得分为0.37469,公开集GAP得分为0.36365。
  • 频率相关技巧——基于地标频率对A1B1、A1B2、A2B1、A2B2、A3B1、A3B2中的图像进行重排序——使GAP从0.35988提升至0.37469。
  • 采用多个CNN主干网络结合ArcMargin损失与PCA,在降低特征维度的同时保持了强大的判别能力。
  • 将局部特征(SURF、Hessian-Affine、SIFT)与全局特征结合,显著提升了在困难、经过变换样本上的性能。
  • 通过将基于频率的重排序扩展至所有评分等级,最终模型实现了0.38231的私有集GAP与0.36805的公开集GAP。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。