[论文解读] Knowledge Transfer via Dense Cross-Layer Mutual-Distillation
本文提出了一种密集跨层互知识蒸馏(Dense Cross-Layer Mutual-Distillation, DCM)方法,一种双向知识迁移技术,通过在隐藏层中引入辅助分类器,并在对应层与非对应层之间实现密集双向蒸馏,联合从零开始训练学生网络与教师网络。该方法在不增加最终模型参数量的前提下,提升了表征学习能力与性能,在图像分类基准上优于以往的一维与双向知识蒸馏方法。
Knowledge Distillation (KD) based methods adopt the one-way Knowledge Transfer (KT) scheme in which training a lower-capacity student network is guided by a pre-trained high-capacity teacher network. Recently, Deep Mutual Learning (DML) presented a two-way KT strategy, showing that the student network can be also helpful to improve the teacher network. In this paper, we propose Dense Cross-layer Mutual-distillation (DCM), an improved two-way KT method in which the teacher and student networks are trained collaboratively from scratch. To augment knowledge representation learning, well-designed auxiliary classifiers are added to certain hidden layers of both teacher and student networks. To boost KT performance, we introduce dense bidirectional KD operations between the layers appended with classifiers. After training, all auxiliary classifiers are discarded, and thus there are no extra parameters introduced to final models. We test our method on a variety of KT tasks, showing its superiorities over related methods. Code is available at https://github.com/sundw2014/DCM
研究动机与目标
- 为解决单向知识蒸馏的局限性,即依赖预训练的、固定的教师网络,且在训练过程中无法优化教师网络。
- 通过在学生与教师网络的中间层引入辅助分类器,提升知识表征学习能力。
- 通过在对应层与非对应层之间实现双向、密集的跨层蒸馏,提升相互之间的知识迁移效果。
- 在不向最终模型中引入额外参数的前提下,实现更优的知识迁移性能。
- 证明通过深度监督与相互蒸馏从零开始联合训练学生与教师网络,可实现比传统知识蒸馏(KD)或深度监督对比学习(DML)更优的泛化能力。
提出的方法
- 在学生与教师网络的特定隐藏层中添加辅助分类器,以实现深度监督,并提供中间监督信号。
- 在学生与教师网络的同阶段与不同阶段层之间应用密集双向知识蒸馏,利用来自两个网络的软标签。
- 蒸馏过程利用辅助分类器的概率输出,在层间传递知识,减少不同阶段特征之间的语义差距。
- 训练完成后移除辅助分类器,确保最终学生或教师模型中不保留任何额外参数。
- 该方法从零开始联合训练两个网络,无需预训练教师网络,并采用多分支损失函数,结合交叉熵损失与蒸馏损失。
- 该架构在 ResNet-18/ResNet-50 与 MobileNetV2 主干网络上进行评估,辅助分类器被放置在关键的下采样阶段,以保持特征层次结构的一致性。
实验结果
研究问题
- RQ1通过在学生与教师网络的中间层引入辅助分类器,是否能够通过深度监督提升双向知识迁移的效果?
- RQ2在同阶段与不同阶段层之间实施密集双向蒸馏,是否能带来比标准单向或双向 KD 更优的表征学习与性能表现?
- RQ3从零开始联合训练学生与教师网络,是否能够超越依赖预训练、固定教师网络的方法?
- RQ4辅助分类器的使用在相互蒸馏过程中,对不同网络深度间知识的语义对齐产生何种影响?
- RQ5所提方法在不增加推理参数的前提下,能在多大程度上缩小学生与教师网络之间的性能差距?
主要发现
- DCM 在图像分类任务中达到最先进性能,在相同设置下优于单向 KD 与双向 DML 方法。
- 在中间层添加辅助分类器显著提升了知识表征学习能力,带来更好的泛化性能与更快的收敛速度。
- 密集跨层双向蒸馏,特别是非对应层之间的蒸馏,有效减少了语义差距,增强了网络间的特征迁移能力。
- 在 CIFAR-100 与 ImageNet 数据集上,该方法在不使用预训练教师网络的前提下,仍实现了优于现有 KD 方法的准确率提升。
- 所有辅助分类器在训练后被移除,确保最终模型不包含任何额外参数,使其适用于资源受限设备的部署。
- 消融实验表明,深度监督与双向蒸馏均为方法成功的关键组件,二者均独立地对性能提升有显著贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。