[论文解读] Supporting large-scale image recognition with out-of-domain samples
该论文提出了一种用于大规模图像识别的端到端方法,采用全局CNN嵌入与弧边 margin 损失,并结合域外图像重排序,以提升地标识别性能。通过利用已知的非地标图像对相似度分数进行惩罚,该方法在2020年Google地标识别挑战赛中取得最先进性能,公共GAP得分为0.6824,荣获第一名。
This article presents an efficient end-to-end method to perform instance-level recognition employed to the task of labeling and ranking landmark images. In a first step, we embed images in a high dimensional feature space using convolutional neural networks trained with an additive angular margin loss and classify images using visual similarity. We then efficiently re-rank predictions and filter noise utilizing similarity to out-of-domain images. Using this approach we achieved the 1st place in the 2020 edition of the Google Landmark Recognition challenge.
研究动机与目标
- 解决大规模实例级图像识别中的极端类别不平衡与高比例域外图像的问题。
- 通过有效区分地标与非地标图像,提升在Google地标数据集v2 CLEAN上的排序性能。
- 开发一种稳健的重排序策略,基于与已知域外(非地标)图像的相似度对预测结果进行惩罚。
- 通过集成多种CNN主干网络与统一的重排序流水线,在2020年Google地标识别竞赛中实现顶尖性能。
提出的方法
- 使用弧边 margin 损失训练多个CNN主干网络(SE-ResNeXt101、EfficientNet B3、ResNet152、Res2Net101),将图像嵌入到512维特征空间。
- 采用广义均值(GeM)池化,随后通过简单颈部结构(全连接 + 批归一化 + PReLU)生成归一化图像嵌入。
- 应用重排序过程,通过候选图像与已知非地标图像的平均相似度(B)来惩罚测试图像与候选图像之间的相似度(A)。
- 使用分位数变换对测试集、训练集与非地标集的嵌入分布进行归一化,以稳定相似度分数。
- 通过拼接L2归一化后的嵌入表示实现模型集成,并对组合表示应用相同的重排序流水线。
- 对每张图像取最相似的前3个候选结果,对同一地标的结果分数求和,并通过与前10个非地标图像的相似度应用最终置信度惩罚(C)
实验结果
研究问题
- RQ1如何有效利用域外(非地标)图像以提升大规模实例级识别中的排序性能?
- RQ2基于与已知非地标图像相似度的重排序,在类别极度不平衡的数据集中,能在多大程度上提升全局平均精度(GAP)?
- RQ3仅使用全局图像嵌入是否能在大规模地标识别任务中超越依赖局部描述符的方法?
- RQ4通过集成多种主干网络与训练配置,如何提升模型在地标识别任务中的鲁棒性与泛化能力?
主要发现
- 所提出的重排序方法显著提升了GAP,即使测试图像本身是地标,也通过惩罚与已知非地标图像相似的预测结果实现性能提升。
- 采用七种不同主干网络与训练超参数的模型集成,取得了公共排行榜得分0.6824与私有排行榜得分0.6598。
- 基于局部描述符的模型(如DELG与SuperPoint)性能提升微乎其微,且因计算成本过高而被舍弃。
- 在GLDv1上进行预训练并未提升性能,对最终解决方案而言并非必要。
- 在测试集、训练集与非地标集的嵌入分布上应用分位数归一化,显著提升了分数稳定性与相似度一致性。
- 最终解决方案在不依赖目标检测或类别频率惩罚的情况下,仅通过基于相似度的重排序与域外监督,实现了最先进性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。