Skip to main content
QUICK REVIEW

[论文解读] Efficient large-scale image retrieval with deep feature orthogonality and Hybrid-Swin-Transformers

Christof Henkel|arXiv (Cornell University)|Oct 7, 2021
Advanced Image and Video Retrieval Techniques被引用 5
一句话总结

本文提出了一种用于大规模图像检索与地标识别的端到端深度学习流水线,结合了局部与全局特征的深度正交融合(DOLG)与一种新型混合-Swin-Transformer架构。该方法采用子中心ArcFace损失函数并引入动态边界,结合一种软判别性重排序策略,在2021年谷歌地标竞赛中斩获双赛道冠军,实现最先进性能。

ABSTRACT

We present an efficient end-to-end pipeline for largescale landmark recognition and retrieval. We show how to combine and enhance concepts from recent research in image retrieval and introduce two architectures especially suited for large-scale landmark identification. A model with deep orthogonal fusion of local and global features (DOLG) using an EfficientNet backbone as well as a novel Hybrid-Swin-Transformer is discussed and details how to train both architectures efficiently using a step-wise approach and a sub-center arcface loss with dynamic margins are provided. Furthermore, we elaborate a novel discriminative re-ranking methodology for image retrieval. The superiority of our approach was demonstrated by winning the recognition and retrieval track of the Google Landmark Competition 2021.

研究动机与目标

  • 解决大规模地标识别与检索中长尾类别分布、类内可变性及噪声标签带来的挑战。
  • 通过单阶段模型中的深度正交融合,提升局部与全局特征的表征能力。
  • 利用带动态边距的子中心ArcFace提升模型泛化能力与鲁棒性,以更好应对类别不平衡问题。
  • 开发一种新型软判别性重排序方法,通过利用查询图像与索引图像之间的标签一致性,提升检索准确率。
  • 在代码竞赛环境下,于严格的推理时间与资源约束下,实现最先进性能。

提出的方法

  • 提出DOLG-EfficientNet-B5架构,通过空间自注意力后进行正交融合,将空洞卷积提取的1024维局部特征与全局特征融合。
  • 提出一种新型混合-Swin-Transformer模型,结合EfficientNet主干网络与Swin Transformer模块,以增强局部与全局特征学习能力。
  • 采用带动态边距的子中心ArcFace损失函数,以提升在长尾与噪声数据分布下的判别能力。
  • 采用分阶段训练策略,在8张V100 GPU上使用混合精度训练,并通过albumentations(平移、缩放、旋转、Cutout)进行数据增强。
  • 应用软判别性重排序流程:对匹配标签,将前3名余弦相似度相加以实现“上提”(up-ranking);对非匹配标签,减去0.1倍前3名相似度以实现“下压”(down-ranking)。
  • 通过平均每类模型的特征表示并拼接,聚合8个模型(DOLG、混合-Swin、纯EfficientNet)的预测结果,形成1536维向量用于最终推理。

实验结果

研究问题

  • RQ1在类别不平衡与类内可变性条件下,深度正交融合局部与全局特征是否能提升大规模地标检索的性能?
  • RQ2所提出的混合-Swin-Transformer架构在结合CNN与Transformer优势方面,对地标识别的有效性如何?
  • RQ3在GLDv2等长尾、噪声数据集上,带动态边距的子中心ArcFace是否优于标准ArcFace?
  • RQ4软判别性重排序策略是否能在不依赖硬阈值的情况下显著提升检索任务的mAP?
  • RQ5单阶段端到端模型在大规模实例级识别任务中,能否显著优于两阶段流水线?

主要发现

  • DOLG-EfficientNet-B5模型在检索赛道上取得私有mAP 0.478与公开mAP 0.464,优于集成中其他模型。
  • 混合-Swin-Transformer模型(EfficientNet-B6-Swin-Base-384)在检索赛道上取得私有mAP 0.487与公开mAP 0.462,证明了混合CNN-Transformer设计的有效性。
  • 最终集成模型在检索赛道上取得私有mAP 0.537与公开mAP 0.518,夺得竞赛第一名。
  • 识别集成模型取得私有GAP 0.513与公开GAP 0.534,在识别赛道排名第一。
  • 软判别性重排序流程通过增强标签一致性并减少误报,显著提升了检索性能。
  • 子中心ArcFace结合动态边距与深度正交融合的组合,显著提升了在噪声与长尾数据上的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。