Skip to main content
QUICK REVIEW

[论文解读] DALG: Deep Attentive Local and Global Modeling for Image Retrieval

Yuxin Song, Ruolin Zhu|arXiv (Cornell University)|Jul 1, 2022
Advanced Image and Video Retrieval Techniques被引用 7
一句话总结

该论文提出DALG,一种完全基于注意力机制的单阶段图像检索框架,通过利用Swin-Transformer提取全局特征,并采用基于窗口的多头注意力与空间注意力机制提取局部特征,以单尺度推理替代多尺度测试。该方法引入可学习的交叉注意力模块实现层级特征融合,在显著提升推理效率的同时实现最先进精度。

ABSTRACT

Deeply learned representations have achieved superior image retrieval performance in a retrieve-then-rerank manner. Recent state-of-the-art single stage model, which heuristically fuses local and global features, achieves promising trade-off between efficiency and effectiveness. However, we notice that efficiency of existing solutions is still restricted because of their multi-scale inference paradigm. In this paper, we follow the single stage art and obtain further complexity-effectiveness balance by successfully getting rid of multi-scale testing. To achieve this goal, we abandon the widely-used convolution network giving its limitation in exploring diverse visual patterns, and resort to fully attention based framework for robust representation learning motivated by the success of Transformer. Besides applying Transformer for global feature extraction, we devise a local branch composed of window-based multi-head attention and spatial attention to fully exploit local image patterns. Furthermore, we propose to combine the hierarchical local and global features via a cross-attention module, instead of using heuristically fusion as previous art does. With our Deep Attentive Local and Global modeling framework (DALG), extensive experimental results show that efficiency can be significantly improved while maintaining competitive results with the state of the arts.

研究动机与目标

  • 解决现有图像检索方法依赖多尺度测试以实现鲁棒性能所导致的效率低下问题。
  • 通过用完全基于注意力的架构替代卷积网络,改善单阶段图像检索中有效性与效率的权衡。
  • 设计一种新颖的局部特征提取分支,利用基于窗口与空间注意力机制捕捉多样化的视觉模式。
  • 以可学习的交叉注意力机制替代启发式特征融合策略,实现更优的局部与全局特征整合。
  • 仅使用单尺度输入实现高性能图像检索,从而降低计算复杂度。

提出的方法

  • 采用Swin-Transformer作为主干网络进行全局特征提取,利用其分层与局部自注意力设计。
  • 引入一个局部分支,结合基于窗口的多头自注意力与空间注意力机制,以建模重叠区域中的局部视觉模式。
  • 采用重叠窗口划分策略,以保留关键边界信息并提升局部特征表示能力。
  • 应用可学习的交叉注意力模块,实现局部与全局特征的分层融合,替代手工设计的正交融合方式。
  • 实施梯度停止训练策略,通过在特定特征阶段停止反向传播,实现全局与局部分支的优化解耦。
  • 对全局特征使用ArcFace损失,对局部特征使用辅助交叉熵损失,并在中间层停止梯度,以促进独立学习。

实验结果

研究问题

  • RQ1完全基于注意力的模型是否能在保持高精度的同时,消除单阶段图像检索中对多尺度测试的需求?
  • RQ2基于窗口的多头注意力在局部特征提取中与全特征图注意力相比表现如何?
  • RQ3可学习的交叉注意力融合是否优于手工设计的正交融合策略,以实现局部与全局特征的更好结合?
  • RQ4梯度停止策略对联合训练设置下局部与全局特征学习性能的影响如何?
  • RQ5与标准卷积操作相比,基于自注意力机制的局部分支是否能更有效地建模多样化的视觉模式?

主要发现

  • 所提出的O-Win-MSA(重叠窗口-based多头自注意力)在Roxf-M上达到78.01 mAP,在Rpar-M上达到88.97 mAP,优于非重叠与全特征图注意力方法。
  • 可学习的交叉注意力融合方法在Roxf-M与Rpar-M上分别较正交融合提升1.13与0.12 mAP。
  • 在Swin-Transformer的第二阶段与局部特征头处停止反向传播时,mAP达到最优,分别为78.01(Roxf-M)与88.97(Rpar-M)。
  • 消融实验表明,梯度停止策略增强了特征学习的独立性,相比全反向传播,性能提升1.5–2.0 mAP点。
  • DALG在消除多尺度测试的同时实现具有竞争力的mAP分数,显著降低推理复杂度。
  • 该模型在Google Landmark v2、Rparis与Roxford数据集上实现最先进性能,且仅依赖单尺度推理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。