[论文解读] TransGeo: Transformer Is All You Need for Cross-view Image Geo-localization
TransGeo 提出了一种纯基于 Transformer 的跨视角图像地理定位方法,摒弃了极坐标变换和数据增强的依赖。通过使用注意力引导的非均匀裁剪,聚焦于信息量丰富的图像块,并将计算资源重新分配至这些区域的更高分辨率处理,该方法在显著降低 FLOPs 和推理时间的同时,实现了最先进的性能表现,优于基于 CNN 的方法。
The dominant CNN-based methods for cross-view image geo-localization rely on polar transform and fail to model global correlation. We propose a pure transformer-based approach (TransGeo) to address these limitations from a different perspective. TransGeo takes full advantage of the strengths of transformer related to global information modeling and explicit position information encoding. We further leverage the flexibility of transformer input and propose an attention-guided non-uniform cropping method, so that uninformative image patches are removed with negligible drop on performance to reduce computation cost. The saved computation can be reallocated to increase resolution only for informative patches, resulting in performance improvement with no additional computation cost. This "attend and zoom-in" strategy is highly similar to human behavior when observing images. Remarkably, TransGeo achieves state-of-the-art results on both urban and rural datasets, with significantly less computation cost than CNN-based methods. It does not rely on polar transform and infers faster than CNN-based methods. Code is available at https://github.com/Jeff-Zilence/TransGeo2022.
研究动机与目标
- 解决基于 CNN 的跨视角地理定位方法依赖极坐标变换且在全局相关性建模方面表现不佳的局限性。
- 利用视觉 Transformer 的全局建模能力和显式位置编码能力,提升地理定位性能。
- 开发一种灵活且计算高效的方案,避免处理无信息量的图像块而不损失性能。
- 通过基于注意力图的自适应非均匀裁剪,实现更快的推理速度和更低的内存占用。
- 证明纯 Transformer 模型可在无需领域特定预处理或数据增强的情况下,超越 CNN 在跨视角地理定位中的表现。
提出的方法
- 提出一种纯视觉 Transformer 架构(TransGeo)用于跨视角图像地理定位,替代 CNN 并消除对极坐标变换的需求。
- 引入可学习的 2D 位置嵌入,显式编码图像块之间的空间关系,提升几何对应学习能力。
- 采用注意力引导的非均匀裁剪:模型首先从最后一层 Transformer 编码器计算注意力图,以识别信息丰富的图像块,随后仅在这些区域提高分辨率。
- 将原本用于无信息量图像块的计算资源重新分配至关键区域的高分辨率处理,实现在不增加总 FLOPs 的前提下提升性能。
- 使用自适应锐度感知最小化(ASAM)以提升泛化能力并减少过拟合,尤其在中等规模数据集上表现更优。
- 采用两阶段训练流程:首先在完整输入上进行训练,然后在注意力图引导下的裁剪并放大图像块上进行微调。
实验结果
研究问题
- RQ1纯 Transformer 方法是否能在不依赖极坐标变换的前提下,超越基于 CNN 的方法在跨视角图像地理定位中的表现?
- RQ2注意力图是否可有效用于引导非均匀裁剪,在降低计算量的同时保持或提升性能?
- RQ3在存在较大领域差异的情况下,视觉 Transformer 中使用可学习位置嵌入是否能提升跨视角地理定位性能?
- RQ4通过移除无信息量图像块所节省的计算资源,是否可重新分配至信息丰富区域以提升分辨率,从而在不增加额外 FLOP 成本的前提下实现性能提升?
- RQ5所提出的“关注并放大”策略与人类视觉注意力在图像理解中的表现相比如何?
主要发现
- TransGeo 在城市(CVUSA)和农村(VIGOR)数据集上均达到最先进性能,优于先前基于 CNN 的方法(如 SAFA)。
- 在 CVUSA 数据集上,TransGeo 在 320×320 分辨率下实现 94.08% 的 Recall@1,且仅保留 0.64 的图像块比例,相比基线提升 1.0%,同时 FLOPs 显著降低。
- 注意力引导的非均匀裁剪在 VIGOR 上移除了 36% 的图像块(β=0.64),仅导致 Recall@1 下降 0.36%,在 CVUSA 上仅下降 0.1%,证明无信息量图像块可被安全丢弃。
- 将计算资源重新分配至选定图像块以提升分辨率(γ=1.56),使 CVUSA 上的 Recall@1 相比基线提升 1.0%,且总 FLOPs 未增加。
- 可学习的位置嵌入显著优于固定正弦位置嵌入,在 CVUSA 上将 Recall@1 从 42.72% 提升至 93.18%,证明其在跨视角对齐中的关键作用。
- 可视化结果显示注意力图展现出强大的全局相关性学习能力,尤其在深层网络中更为明显,证实 Transformer 具备建模跨视角长距离依赖关系的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。