[论文解读] Generalization in Metric Learning: Should the Embedding Layer be the Embedding Layer?
本文研究了深度度量学习在细粒度图像检索中的泛化性能,表明在损失函数之前的倒数第二层(即最终嵌入层之前)通常比标准嵌入层泛化性能更优。通过分析多个网络层的特征表现,作者发现越接近损失函数的层在训练数据上过拟合更严重,而如倒数第二层等更浅的层则展现出更优的测试性能,从而在Cars-196、CUB-200-2011和Stanford Online Products基准上取得了当前最优的结果。
This work studies deep metric learning under small to medium scale data as we believe that better generalization could be a contributing factor to the improvement of previous fine-grained image retrieval methods; it should be considered when designing future techniques. In particular, we investigate using other layers in a deep metric learning system (besides the embedding layer) for feature extraction and analyze how well they perform on training data and generalize to testing data. From this study, we suggest a new regularization practice where one can add or choose a more optimal layer for feature extraction. State-of-the-art performance is demonstrated on 3 fine-grained image retrieval benchmarks: Cars-196, CUB-200-2011, and Stanford Online Product.
研究动机与目标
- 研究深度度量学习网络中不同层在测试数据上的泛化能力,特别是在小到中等规模数据设置下的表现。
- 挑战传统假设,即最终嵌入层在度量学习中是特征提取的最优选择。
- 探究是否存在其他层(尤其是倒数第二层)能够实现更好的泛化与检索性能。
- 提出一种基于层选择的新正则化方法,以提升度量学习中的泛化性能。
提出的方法
- 作者使用对比损失或三元组损失训练一个深度度量学习网络,并从多个中间层提取特征,而不仅限于最终的嵌入层。
- 在多个基准上,使用标准检索指标(如Recall@1,R@1)评估训练集和测试集上的特征性能。
- 比较最后一层(fc6)与倒数第二层(pool5.3)及其他中间层的性能,分析其在训练数据上的拟合程度与在测试数据上的泛化能力。
- 在多种架构和数据集(包括Cars-196、CUB-200-2011、Stanford Online Products以及Revisited Oxford-Paris基准)上进行消融实验。
- 分析层的深度、距损失函数的距离以及嵌入维度对泛化与拟合性能的影响。
- 在自训练模型和公开发布的模型(如lifted structure、HDC)上验证其发现,确认结果在不同架构间具有一致性。
实验结果
研究问题
- RQ1在细粒度图像检索的深度度量学习中,最终嵌入层是否始终具有最佳泛化性能?
- RQ2中间层在训练拟合与测试泛化方面的性能与嵌入层相比如何?
- RQ3尽管在训练准确率上表现较差,为何倒数第二层在测试性能上常优于最终层?
- RQ4层的深度或距损失函数的距离在多大程度上影响度量学习中的泛化性能?
- RQ5选择不同的层进行特征提取,是否可以在不修改损失函数或网络架构的前提下实现当前最优性能?
主要发现
- 在使用相同DML训练的网络下,倒数第二层(pool5.3)在Cars-196测试集上达到65.1%的R@1,优于最终层的47.9% R@1。
- 在CUB-200-2011基准上,倒数第二层达到66.4% R@1,而最终层仅为46.3%,展现出更优的泛化能力。
- 在Stanford Online Products数据集上,倒数第二层实现74.8% R@1,优于最终层的74.1% R@1,泛化性能持续提升。
- 在Revisited Oxford-5k与Paris-6k基准中,倒数第二层在Easy与Medium设置下均取得更优的mP@1性能,与R@1趋势一致。
- 尽管在训练数据上拟合不足,倒数第二层仍展现出更优的泛化性能,表明对损失层的过拟合会损害测试阶段的性能。
- 该发现适用于多种模型,包括公开发布的lifted structure与HDC模型,证实其在不同架构间的稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。