Skip to main content
QUICK REVIEW

[论文解读] Transformer-Guided Convolutional Neural Network for Cross-View Geolocalization

Teng Wang, Shujuan Fan|arXiv (Cornell University)|Apr 21, 2022
Advanced Image and Video Retrieval Techniques被引用 6
一句话总结

本文提出 TransGCNN,一种用于跨视角地理定位的轻量化 Transformer 引导 CNN 架构,通过多尺度窗口 Transformer 头(作为空间注意力模块)增强 CNN 特征。该方法在 CVUSA 上实现 94.12% 的 top-1 准确率,在 CVACT_val 上达到 84.92%,性能优于先前模型,同时参数量少于 50%,推理帧率接近翻倍。

ABSTRACT

Ground-to-aerial geolocalization refers to localizing a ground-level query image by matching it to a reference database of geo-tagged aerial imagery. This is very challenging due to the huge perspective differences in visual appearances and geometric configurations between these two views. In this work, we propose a novel Transformer-guided convolutional neural network (TransGCNN) architecture, which couples CNN-based local features with Transformer-based global representations for enhanced representation learning. Specifically, our TransGCNN consists of a CNN backbone extracting feature map from an input image and a Transformer head modeling global context from the CNN map. In particular, our Transformer head acts as a spatial-aware importance generator to select salient CNN features as the final feature representation. Such a coupling procedure allows us to leverage a lightweight Transformer network to greatly enhance the discriminative capability of the embedded features. Furthermore, we design a dual-branch Transformer head network to combine image features from multi-scale windows in order to improve details of the global feature representation. Extensive experiments on popular benchmark datasets demonstrate that our model achieves top-1 accuracy of 94.12\% and 84.92\% on CVUSA and CVACT_val, respectively, which outperforms the second-performing baseline with less than 50% parameters and almost 2x higher frame rate, therefore achieving a preferable accuracy-efficiency tradeoff.

研究动机与目标

  • 为解决地理定位中地面视角与航拍视角之间存在的巨大视觉与几何差异挑战。
  • 通过结合基于 CNN 的局部特征与基于 Transformer 的全局上下文建模,提升特征表示学习能力。
  • 设计一种高效架构,在显著降低模型大小与推理时间的同时保持高精度。
  • 探索多尺度窗口注意力在捕捉全局与局部上下文线索方面的有效性,以提升定位性能。
  • 与现有 CNN 及 Transformer 模型相比,实现更优的精度-效率权衡。

提出的方法

  • 提出一种混合网络架构,由基于 VGG16 的 CNN 主干网络用于局部特征提取,以及一个轻量化 Transformer 头用于全局上下文建模。
  • Transformer 头作为空间感知的重要性生成器,学习注意力图以选择关键的 CNN 特征用于最终表征。
  • 设计双分支 Transformer 头,处理多尺度窗口的特征:一个全局分支与一个使用非重叠垂直分割的部分级分支。
  • 通过动态融合来自全局分支与部分级分支的特征图,实现互补并丰富场景表征。
  • 采用对比损失进行端到端训练,以优化嵌入空间中的跨视角匹配性能。
  • 通过实验调优注意力通道数 K,最终选定 K=8 为性能最优配置。

实验结果

研究问题

  • RQ1轻量化的 Transformer 头能否有效增强基于 CNN 的特征以实现跨视角地理定位?
  • RQ2与标准全局自注意力相比,多尺度窗口注意力如何提升特征表示?
  • RQ3在精度与效率之间取得平衡时,注意力通道数 K 的最优值是多少?
  • RQ4所提方法能否在显著减少模型大小与更快推理速度的前提下实现 SOTA 性能?
  • RQ5在视觉差异显著的困难负样本上,模型表现如何?

主要发现

  • 在 CVUSA 基准测试中,TransGCNN 实现 94.12% 的 top-1 准确率,优于第二好的基线模型。
  • 在 CVACT_val 数据集上,模型达到 84.92% 的 top-1 准确率,展现出在具有挑战性的真实世界数据上的强大泛化能力。
  • 模型参数量少于第二佳性能基线模型的 50%,显著提升了模型效率。
  • 推理帧率接近第二佳模型的两倍,TransGCNN 实现了更优的精度-效率权衡。
  • 消融实验表明,当注意力通道数 K 从 1 增加到 8 时,r@1 提升 9.73 个百分点,且在 K>4 后收益递减。
  • 可视化结果证实,模型能够聚焦于道路、建筑等显著结构,而基线方法主要区分前景与背景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。