[论文解读] S2SD: Simultaneous Similarity-based Self-Distillation for Deep Metric Learning
S2SD 提出了一种用于深度度量学习的新型自蒸馏框架,该框架在不增加推理时间成本的前提下,同时训练高维辅助嵌入空间,并将其相似性知识蒸馏到低维基础嵌入空间中,从而提升泛化能力。该方法在标准基准测试中实现了 Recall@1 最高达 7% 的相对提升,达到新的 SOTA 水平,同时保持极低的训练开销。
Deep Metric Learning (DML) provides a crucial tool for visual similarity and zero-shot applications by learning generalizing embedding spaces, although recent work in DML has shown strong performance saturation across training objectives. However, generalization capacity is known to scale with the embedding space dimensionality. Unfortunately, high dimensional embeddings also create higher retrieval cost for downstream applications. To remedy this, we propose \emph{Simultaneous Similarity-based Self-distillation (S2SD). S2SD extends DML with knowledge distillation from auxiliary, high-dimensional embedding and feature spaces to leverage complementary context during training while retaining test-time cost and with negligible changes to the training time. Experiments and ablations across different objectives and standard benchmarks show S2SD offers notable improvements of up to 7% in Recall@1, while also setting a new state-of-the-art. Code available at https://github.com/MLforHealth/S2SD.
研究动机与目标
- 解决尽管模型容量高,但深度度量学习性能仍出现饱和的问题。
- 在不增加测试时检索成本的前提下,提升低维嵌入空间的泛化能力。
- 利用高维辅助表示进行知识蒸馏,而无需依赖外部教师模型。
- 实现高效的单阶段训练,通过更高维特征中的互补上下文信息提升基础模型性能。
- 探索多尺度蒸馏与分层知识迁移,以增强表征学习能力。
提出的方法
- 提出一种并行训练设置,通过共享的特征主干网络,同时学习高维辅助嵌入空间与基础嵌入空间。
- 通过将高维辅助空间中的相似性关系转移到低维基础空间,实现知识蒸馏。
- 采用基于相对相似性排序(例如使用 KL 散度)的蒸馏损失,比较辅助空间与基础空间中样本对的相似性关系。
- 在不同维度上设置多个蒸馏分支,以实现多尺度知识迁移并提升特征复用性。
- 实现可分离的辅助分支,以在反向传播过程中防止梯度干扰,同时保留蒸馏信号。
- 在特征主干网络与基础嵌入空间之间集成蒸馏,以提升特征利用效率与表征质量。
实验结果
研究问题
- RQ1高维辅助表示能否提升深度度量学习中低维基础嵌入的泛化能力?
- RQ2从辅助嵌入空间进行的并行自蒸馏是否优于使用外部教师模型的标准蒸馏方法?
- RQ3蒸馏目标的选择(如 R-KL、余弦相似度、欧氏距离)如何影响性能与稳定性?
- RQ4为实现有效知识迁移,辅助网络的最佳深度与宽度应如何选择?
- RQ5从较早或较晚的特征层进行蒸馏是否表现更优?这种差异如何随网络深度变化?
主要发现
- 在 CUB200-2011 数据集上,S2SD 实现了 Recall@1 7% 的相对提升,显著优于先前的 SOTA 方法。
- 在 CARS196 数据集上,S2SD 相较于基线方法将 Recall@1 提升了最高 2.2%,且在低维设置下增益最为显著。
- 该方法在所有三个基准测试(CUB200-2011、CARS196 和 Stanford Online Products)上均达到了新的 SOTA 水平。
- 从更高维的辅助分支(如 2048 维)进行蒸馏的性能优于低维分支,且在 2048 维时达到最优增益。
- 采用多分支多尺度蒸馏(如 #B=4)相比单分支蒸馏可将性能提升 0.2%,表明多样化表征具有优势。
- 分离式辅助分支的性能更优(R@1 为 66.96%),优于非分离式分支(R@1 为 65.34%),证实了梯度隔离的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。