[论文解读] Correlation Congruence for Knowledge Distillation
本文提出相关性一致知识蒸馏(CCKD),一种新颖的知识蒸馏框架,通过从教师网络向学生网络迁移实例级知识与实例间相关性,提升学生网络性能。通过采用泰勒级数展开的核方法建模相关性,并优化小批量采样策略,CCKD在图像分类与度量学习基准上实现了最先进(SOTA)的准确率,优于标准知识蒸馏及先前的SOTA方法。
Most teacher-student frameworks based on knowledge distillation (KD) depend on a strong congruent constraint on instance level. However, they usually ignore the correlation between multiple instances, which is also valuable for knowledge transfer. In this work, we propose a new framework named correlation congruence for knowledge distillation (CCKD), which transfers not only the instance-level information, but also the correlation between instances. Furthermore, a generalized kernel method based on Taylor series expansion is proposed to better capture the correlation between instances. Empirical experiments and ablation studies on image classification tasks (including CIFAR-100, ImageNet-1K) and metric learning tasks (including ReID and Face Recognition) show that the proposed CCKD substantially outperforms the original KD and achieves state-of-the-art accuracy compared with other SOTA KD-based methods. The CCKD can be easily deployed in the majority of the teacher-student framework such as KD and hint-based learning methods.
研究动机与目标
- 为解决现有知识蒸馏方法仅关注实例级一致性而忽略实例间相关性的局限性。
- 通过保留教师网络嵌入空间中类内一致与类间分离的结构,提升学生网络的泛化能力。
- 提出一种通用的基于核的方法,以捕捉小批量样本间复杂的相关性。
- 探索能增强相关性知识迁移的有效小批量采样策略。
- 在包括图像分类与度量学习在内的多样化视觉任务中,验证CCKD的有效性。
提出的方法
- 提出相关性一致知识蒸馏(CCKD),联合优化教师与学生网络之间的实例级与相关性级知识迁移。
- 采用基于高斯RBF核泰勒级数展开的广义核方法,建模并捕捉小批量内样本间的高阶相关性。
- 使用维度相同的全连接层对齐教师与学生网络的嵌入空间,实现相关性直接比较。
- 提出两种新颖的小批量采样策略——类别均匀随机采样器(CUR-sampler)与超类别均匀随机采样器(SUR-sampler),以平衡类内与类间相关性学习。
- 利用余弦相似度热图可视化并分析学生特征空间中类内凝聚力与类间分离度。
- 使用包含标准知识蒸馏损失与基于核化相关性矩阵推导的相关性一致损失的联合损失函数训练学生网络。
实验结果
研究问题
- RQ1在嵌入空间中保留实例间相关性,是否能超越仅实例级模仿,提升知识蒸馏性能?
- RQ2核方法中泰勒级数展开的阶数如何影响高阶相关性的建模及其下游性能?
- RQ3不同小批量采样策略对相关性知识迁移质量有何影响?
- RQ4CCKD是否能在学生网络的嵌入空间中生成更紧密的类内与更清晰的类间表示?
- RQ5CCKD在多样化视觉任务中与最先进知识蒸馏方法相比表现如何?
主要发现
- 在CIFAR-100上,CCKD实现SOTA性能,相比标准KD提升1.3%的top-1准确率,并超越其他SOTA方法。
- 在ImageNet-1K上,CCKD相比标准KD提升1.1%的top-1准确率,使用ResNet-18时达到74.5%的top-1准确率。
- 在MSMT17 ReID基准上,CCKD使用ResNet-18实现59.6%的rank-1准确率与31.1%的mAP,显著优于标准KD与其他SOTA方法。
- 高斯RBF核的三阶泰勒展开实现最佳性能,相比一阶提升0.7%的mAP,相比二阶提升0.3%的mAP。
- 当k=4时,SUR-sampler实现最高性能(59.6% rank-1,31.1% mAP),在相似设置下优于UR-sampler与CUR-sampler。
- 可视化结果表明,CCKD生成的类内余弦相似度显著高于标准KD,表明学生嵌入空间中类内凝聚力更强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。