[论文解读] Multiple-environment Self-adaptive Network for Aerial-view Geo-localization
本文提出 MuSe-Net,一种用于俯视地理定位的多环境自适应网络,可动态缓解由天气和光照变化引起的域偏移。通过采用双分支架构,包含风格提取分支与使用残差 SPADE 的自适应特征提取器,该模型在 University-1652 和 CVUSA 基准测试中实现了最先进性能,对未见的极端天气条件也表现出优异的泛化能力。
Aerial-view geo-localization tends to determine an unknown position through matching the drone-view image with the geo-tagged satellite-view image. This task is mostly regarded as an image retrieval problem. The key underpinning this task is to design a series of deep neural networks to learn discriminative image descriptors. However, existing methods meet large performance drops under realistic weather, such as rain and fog, since they do not take the domain shift between the training data and multiple test environments into consideration. To minor this domain gap, we propose a Multiple-environment Self-adaptive Network (MuSe-Net) to dynamically adjust the domain shift caused by environmental changing. In particular, MuSe-Net employs a two-branch neural network containing one multiple-environment style extraction network and one self-adaptive feature extraction network. As the name implies, the multiple-environment style extraction network is to extract the environment-related style information, while the self-adaptive feature extraction network utilizes an adaptive modulation module to dynamically minimize the environment-related style gap. Extensive experiments on two widely-used benchmarks, i.e., University-1652 and CVUSA, demonstrate that the proposed MuSe-Net achieves a competitive result for geo-localization in multiple environments. Furthermore, we observe that the proposed method also shows great potential to the unseen extreme weather, such as mixing the fog, rain and snow.
研究动机与目标
- 解决现有地理定位模型在真实世界环境变化(如降雨、雾霾、降雪)下性能下降的问题。
- 克服无人机到卫星图像检索过程中因天气与光照变化导致的跨环境域偏移问题。
- 开发一种自适应机制,在推理阶段无需显式域标签即可过滤环境干扰。
- 通过学习解耦的环境风格表征,实现在未见极端天气条件下的鲁棒地理定位。
- 在不依赖域不变特征学习的前提下,提升在多种环境下的泛化能力,受人类视觉认知启发。
提出的方法
- 提出双分支网络:多环境风格提取分支与自适应特征提取分支。
- 使用残差 SPADE 模块基于环境风格嵌入动态调制特征图,实现自适应域偏移校正。
- 采用度量学习与分类损失端到端训练网络,以优化跨视角检索性能。
- 通过数据增强技术合成多样化的环境条件(如雾霾、降雨、降雪),在无需人工采集的情况下提升训练数据多样性。
- 在特定瓶颈层(S1-B2 与 S1-B3)嵌入残差 SPADE,以有效平衡风格与内容特征。
- 利用生成技术增强训练数据,引入逼真的环境风格,提升对未见条件的鲁棒性。
实验结果
研究问题
- RQ1深度学习模型能否在俯视地理定位过程中,对未见的环境条件(如雾霾、降雨、降雪)实现动态自适应?
- RQ2所提出的自适应特征学习机制在减轻环境变化引起的域偏移方面效果如何?
- RQ3将环境风格与内容特征解耦是否能提升在多样化天气条件下的泛化能力?
- RQ4自适应模块(如残差 SPADE)在神经网络中的最优位置为何?
- RQ5模型能否泛化到训练期间未见的极端天气条件?与现有域泛化方法相比表现如何?
主要发现
- 在 University-1652 数据集上,MuSe-Net 在多种环境条件下实现了 72.45% 的平均精度均值(mAP),优于基线方法。
- 在 CVUSA 数据集上,MuSe-Net 表现具有竞争力,表明其在不同跨视角地理定位基准之间具备良好的可迁移性。
- 消融实验表明,将残差 SPADE 置于第 1 阶段的第二和第三瓶颈层(S1-B2,B3)时性能最佳,mAP 达到 72.45%。
- 模型在未见的极端天气条件(如混合雾霾、降雨与降雪)下仍保持高性能,表明其具备强大的泛化能力。
- 与 IBN-Net 相比,模型参数仅增加 4.21%,浮点运算量(FLOPs)增加 39.34%,计算开销可接受。
- 定性结果表明,模型在不同环境下能一致激活相关地理区域,且在全部 10 种测试条件下均在 Top-1 中检索到真实匹配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。