Skip to main content
QUICK REVIEW

[论文解读] Instance Cross Entropy for Deep Metric Learning

Xinshao Wang, Elyor Kodirov|arXiv (Cornell University)|Nov 22, 2019
Face recognition and analysis参考文献 63被引用 5
一句话总结

本文提出实例交叉熵(ICE),一种用于深度度量学习的新损失函数,通过概率解释建模实例级别的匹配概率,实现对无限类别的可扩展性并提升泛化能力。ICE在三个基准测试中达到最先进性能,优于现有方法(包括复杂的难样本挖掘方法),通过无缝的样本重加权机制实现,无需显式的数据截断。

ABSTRACT

Loss functions play a crucial role in deep metric learning thus a variety of them have been proposed. Some supervise the learning process by pairwise or tripletwise similarity constraints while others take advantage of structured similarity information among multiple data points. In this work, we approach deep metric learning from a novel perspective. We propose instance cross entropy (ICE) which measures the difference between an estimated instance-level matching distribution and its ground-truth one. ICE has three main appealing properties. Firstly, similar to categorical cross entropy (CCE), ICE has clear probabilistic interpretation and exploits structured semantic similarity information for learning supervision. Secondly, ICE is scalable to infinite training data as it learns on mini-batches iteratively and is independent of the training set size. Thirdly, motivated by our relative weight analysis, seamless sample reweighting is incorporated. It rescales samples' gradients to control the differentiation degree over training examples instead of truncating them by sample mining. In addition to its simplicity and intuitiveness, extensive experiments on three real-world benchmarks demonstrate the superiority of ICE.

研究动机与目标

  • 解决现有深度度量学习损失函数的局限性,特别是其对无限类别的可扩展性不足以及对启发式样本挖掘的依赖。
  • 开发一种损失函数,利用小批量中多个实例之间的结构化相似性信息,实现更优的监督。
  • 通过引入可微的、基于梯度的重加权机制,消除对距离边界约束和显式样本挖掘的需求。
  • 在不假设固定类内方差或类间边界的前提下,实现在真实世界基准上的优异性能。

提出的方法

  • ICE 将深度度量学习建模为实例级别的 Softmax 回归,通过最小化预测与真实实例级别匹配分布之间的交叉熵来优化。
  • 该方法将特征投影到单位超球面上,实现无需显式边界约束的角嵌入空间学习。
  • 单个权重缩放超参数 $ s $ 通过重标度梯度来控制样本之间的区分度,实现无需数据截断的样本挖掘模拟。
  • 重加权机制源自成对样本间的相对权重分析,当 $ s $ 增大时,动态增强更难样本的权重。
  • ICE 不学习类级别的代理表示,因此天然具备对无限训练类别的可扩展性。
  • 损失函数通过标准反向传播端到端训练,除权重缩放参数外无需额外组件。

实验结果

研究问题

  • RQ1基于概率的、实例级别的匹配建模是否能在保持对无限类别可扩展性的同时提升深度度量学习性能?
  • RQ2如何有效利用小批量中多个实例之间的结构化相似性信息进行监督,而无需依赖成对或三元组约束?
  • RQ3基于梯度的重加权能否替代深度度量学习中的显式样本挖掘?若能,其性能与复杂度如何?
  • RQ4消除距离边界约束是否能带来更好的泛化性能,特别是在类内方差未知或可变的数据集中?

主要发现

  • ICE 在三个真实世界基准(SOP、CUB-200-2011 和 Cars-196)上均取得最佳 Recall@1 性能,SOP 上达到 77.3%。
  • ICE 性能与最先进方法 RLL(SOP 上 Recall@1 为 78.2%)相当,但参数更少、结构更简单。
  • 当 $ s = 80 $ 时,性能显著下降,表明过度强调极难样本(如异常值)会损害学习过程,凸显了受控重加权的必要性。
  • ICE 显著优于在 ImageNet 上微调的标准 CCE,证明 CCE 不适合 DML,因其依赖类级别代理学习且缺乏可扩展性。
  • 补充材料中的 t-SNE 可视化结果表明,与基线方法相比,ICE 学习到的嵌入更具紧凑性且分离度更高。
  • 在所评估的方法中,ICE 是唯一具有清晰概率解释、并最大化联合实例级别匹配概率的方法,而大多数 SOTA 方法并非如此。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。