[论文解读] 3rd Place Solution to Google Landmark Recognition Competition 2021
本论文展示了在2021年Google地标识别竞赛中获得第三名的解决方案,采用多架构模型(CNN、Transformer及混合模型)结合ArcFace损失函数进行特征嵌入。该方法通过结合检索分数、分类logits、干扰项得分惩罚以及top-1分类聚合的重排序流水线,实现了私有排行榜0.48962的得分。
In this paper, we show our solution to the Google Landmark Recognition 2021 Competition. Firstly, embeddings of images are extracted via various architectures (i.e. CNN-, Transformer- and hybrid-based), which are optimized by ArcFace loss. Then we apply an efficient pipeline to re-rank predictions by adjusting the retrieval score with classification logits and non-landmark distractors. Finally, the ensembled model scores 0.489 on the private leaderboard, achieving the 3rd place in the 2021 edition of the Google Landmark Recognition Competition.
研究动机与目标
- 解决大规模、类别不平衡数据集中存在高类别内差异和非地标图像的实例级地标识别问题。
- 通过结合不同模型架构(CNN、Transformer、混合模型)实现互补特征学习,提升检索准确率。
- 通过整合分类logits并基于非地标相似度对预测进行惩罚,提升预测可靠性。
- 通过嵌入的归一化拼接与端到端重排序优化模型集成。
- 通过稳健且可扩展的流水线,在Google地标识别2021竞赛中实现最先进性能。
提出的方法
- 使用多个主干网络提取512维图像嵌入:EfficientNet-B5/B6/B7/V2(CNN)、Swin-L-384(Transformer)以及CvT-W24-384(混合模型)。
- 通过自适应边缘的ArcFace损失优化嵌入,CNN使用GeM池化,Transformer使用直接标记池化。
- 采用多阶段训练策略:首先在GLDv2c(150万张图像,8.1万个类别)上训练,然后在GLDv2x(320万张图像)上继续,最后在GLDv2(410万张图像,20.3万个类别)上进行微调,冻结主干网络并仅微调分类头。
- 使用数据增强(RandAug、CutOut、RandomResizedCrop)并结合分辨率缩放与余弦退火学习率衰减。
- 实现重排序流水线:通过增加分类logits并减去非地标匹配的干扰项得分,调整检索分数。
- 通过拼接L2归一化后的嵌入并重新在组合空间中运行完整推理流水线,实现模型集成。
实验结果
研究问题
- RQ1如何有效结合不同模型架构(CNN、Transformer、混合模型)以提升地标检索性能?
- RQ2分类logits在多大程度上能提升检索准确率,特别是在训练样本极少的稀有地标上?
- RQ3能否将非地标图像相似度得分作为有效的惩罚机制,以减少误报?
- RQ4在结合检索与干扰项调整后,top-1分类logits聚合如何提升最终预测?
- RQ5何种训练策略与数据划分方案能最大化模型泛化能力,尤其是对未见地标?
主要发现
- Swin-L-384模型在公开排行榜上取得了0.383的最高检索分数,优于所有基于CNN的模型。
- Swin-L与CvT-W24-384的集成带来的性能增益显著高于仅集成CNN模型,表明其架构间具有强互补性。
- 最终模型在私有排行榜上取得0.48962的得分,位列竞赛第三。
- 分类logits调整显著提升了预测性能,尤其在低频地标上,B5模型在公开LB上达到约0.39的top-1准确率。
- 干扰项得分惩罚有效减少了非地标图像上的误报,提升了检索的鲁棒性。
- 即使未使用干扰项惩罚,top-1分类logits聚合仍能提供额外增益,因其天然具备抑制非地标预测的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。