[论文解读] Self-supervising Fine-grained Region Similarities for Large-scale Image Localization
本文提出一种自监督框架,通过增强细粒度图像-区域相似性,提升在噪声GPS监督下的大规模图像定位性能。通过迭代优化来自top-k最近邻的软监督,并应用温度退火的对比学习,该方法在无需额外参数或标注的情况下,在基准数据集上实现了最先进性能。
The task of large-scale retrieval-based image localization is to estimate the geographical location of a query image by recognizing its nearest reference images from a city-scale dataset. However, the general public benchmarks only provide noisy GPS labels associated with the training images, which act as weak supervisions for learning image-to-image similarities. Such label noise prevents deep neural networks from learning discriminative features for accurate localization. To tackle this challenge, we propose to self-supervise image-to-region similarities in order to fully explore the potential of difficult positive images alongside their sub-regions. The estimated image-to-region similarities can serve as extra training supervision for improving the network in generations, which could in turn gradually refine the fine-grained similarities to achieve optimal performance. Our proposed self-enhanced image-to-region similarity labels effectively deal with the training bottleneck in the state-of-the-art pipelines without any additional parameters or manual annotations in both training and inference. Our method outperforms state-of-the-arts on the standard localization benchmarks by noticeable margins and shows excellent generalization capability on multiple image retrieval datasets.
研究动机与目标
- 解决大规模图像定位中噪声和弱GPS标签带来的挑战,此类标签会阻碍深度网络学习判别性特征。
- 克服现有方法仅依赖最简单正样本(top-1)进行训练的局限性,从而在不同条件下提升鲁棒性。
- 通过自监督的、区域级别的监督,利用困难正样本改进特征学习,实现跨网络代际的图像-区域相似性优化。
- 通过利用前代网络生成的置信度分数作为软监督信号,指导特征学习,实现在噪声数据上的有效训练。
- 在无需微调的情况下,展示在标准图像检索基准上的泛化能力。
提出的方法
- 以迭代代际方式训练网络,将前一代的基于特征的相似性作为下一代的软监督信号。
- 对于每个查询,从图库集中识别k-互惠最近邻,以恢复更准确的困难正样本,减少误报。
- 将图库图像分解为多个不同尺寸的子区域,以支持细粒度的区域级匹配与监督。
- 利用特征图估计查询-区域相似性,并应用具有温度退火策略的对比学习,以在代际间逐步优化软标签。
- 使用自增强相似性头生成优化后的软监督信号,引导网络学习更具判别性的局部特征。
- 对对比损失应用温度退火调度,逐步降低温度,以提升特征判别能力。
实验结果
研究问题
- RQ1当仅提供噪声GPS标签时,自监督的细粒度区域级相似性是否能提升图像定位性能?
- RQ2如何在不引入误报或导致网络坍缩的情况下,有效利用困难正样本进行训练?
- RQ3在跨网络代际优化图像-区域相似性,是否能产生优于标准图像级监督的特征表示?
- RQ4前代生成的软监督在多大程度上提升了下游图像检索任务的泛化能力?
- RQ5所提方法是否能在不增加额外参数或人工标注的情况下超越最先进基线?
主要发现
- 所提方法在Tokyo 24/7和Oxford5k基准上均达到最先进性能,在Tokyo 24/7上实现93.4%的rank-1召回率,显著优于基线模型。
- 在Pitts250k-test数据集上,该方法实现85.7%的rank-1召回率,较最先进方法SARE高出2.1个百分点。
- 消融实验表明,若移除k-互惠最近邻优化,Tokyo 24/7上的性能下降1.6%,证实其在识别真实正样本中的关键作用。
- Softmax温度退火通过提升特征判别能力改善性能,如在Oxford5k上应用后mAP提升1.2%。
- 该模型在标准图像检索数据集上泛化良好,在Oxford5k(全图)上达到73.9% mAP,在Paris6k(全图)上达到76.7% mAP,优于SARE和NetVLAD。
- 定性分析表明,模型聚焦于如店铺招牌等判别性局部区域,而忽略如树木等误导性特征,与SARE表现不同。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。