Skip to main content
QUICK REVIEW

[论文解读] Team JL Solution to Google Landmark Recognition 2019

Yinzheng Gu, Chuanpeng Li|arXiv (Cornell University)|Jun 10, 2019
Advanced Image and Video Retrieval Techniques参考文献 14被引用 8
一句话总结

该论文提出了一种在 Google Landmark Recognition 2019 竞赛中表现最优的基于检索的解决方案,结合全局与局部 CNN 特征,采用多阶段重排序和集成策略。通过利用清洗后的训练数据、多尺度描述符以及迭代置信度优化,该方法在私有排行榜上取得了 0.37606 的 GAP 得分,最终通过稳健的干扰项过滤和置信度校准获得第一名。

ABSTRACT

In this paper, we describe our solution to the Google Landmark Recognition 2019 Challenge held on Kaggle. Due to the large number of classes, noisy data, imbalanced class sizes, and the presence of a significant amount of distractors in the test set, our method is based mainly on retrieval techniques with both global and local CNN approaches. Our full pipeline, after ensembling the models and applying several steps of re-ranking strategies, scores 0.37606 GAP on the private leaderboard which won the 1st place in the competition.

研究动机与目标

  • 解决大规模地标识别中极端类别不平衡、噪声数据和测试集干扰项丰富的挑战。
  • 开发一种基于检索的系统,在面对 203,094 个类别和 400 万张训练图像时,超越分类模型的表现。
  • 通过清洗训练数据并利用迭代重排序优化预测,提升模型泛化能力和置信度校准。
  • 通过混合全局-局部 CNN 流水线,在 Google Landmark Recognition 2019 竞赛中实现最先进性能。

提出的方法

  • 通过移除图像数 ≤3 张的类别,并利用基于描述符匹配(余弦相似度阈值为 0.5)的方法过滤视觉不一致的类别,完成数据清洗。
  • 使用 ResNet-101、ResNeXt-101、SE-ResNet-101、SE-ResNeXt-101 和 SENet-154 主干网络,结合注意力图和池化操作(GeM、RMAC、MAC、SPoC),训练多个全局 CNN 模型。
  • 通过拼接多个主干网络的描述符,并应用衰减无监督白化(AUW),参数 t=0.5,实现降维。
  • 采用边距为 0.9 的对比损失和边距为 0.2 的三元组损失,在每批包含一个查询、一个正样本和五个难负样本的 10 元组小批量上进行训练。
  • 在推理阶段采用多尺度推理,缩放因子为 (1/√2, 1, √2),对描述符进行求和聚合,随后进行 ℓ² 归一化。
  • 集成基于 D2R 框架的局部 CNN 模型,包含学习到的检测头和嵌入头,以提升细粒度地标检索的准确性。

实验结果

研究问题

  • RQ1如何缓解大规模地标数据集中极端类别不平衡和噪声数据的影响,以提升模型泛化能力?
  • RQ2在超过 20 万个类别的开放词汇地标识别任务中,基于检索的方法在多大程度上能超越基于分类的模型?
  • RQ3多尺度特征提取和描述符融合对长尾分布下的检索性能有何影响?
  • RQ4迭代重排序和置信度校准策略在减少干扰项图像上的误报方面有多有效?

主要发现

  • 最终集成模型在私有排行榜上取得了 0.37606 的 GAP 得分,夺得竞赛第一名。
  • 数据清洗与基于描述符的过滤相结合,将训练集从 410 万张图像减少至 836,964 张图像,涵盖 112,782 个类别。
  • 最佳单模型(Aggregate-7 top-5)在私有排行榜上取得 0.25138 的 GAP 得分,证明了描述符融合的价值。
  • 基于 SVM 的干扰项过滤步骤(Step-2)将得分从 0.25138 提升至 0.29301。
  • 多阶段重排序流程(Step-3),N=550,结合使用 top-1 模型得分进行置信度优化,使得分提升至 0.36787,随后进行最终合并。
  • 最终将 Step-6 和 Step-3 的结果进行模型融合,获得最高私有得分 0.37606,优于基于神经网络的重排序替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。