Skip to main content
QUICK REVIEW

[论文解读] Cross-Layer Distillation with Semantic Calibration

Defang Chen, Jian-Ping Mei|arXiv (Cornell University)|Dec 6, 2020
Advanced Neural Network Applications参考文献 64被引用 4
一句话总结

本文提出了一种用于跨层知识蒸馏的语义校准方法(SemCKD),该方法利用注意力机制自动学习学生网络与教师网络特征之间的软性多层关联,避免了人工配对层导致的语义不匹配问题。该方法在多种网络架构上显著提升了蒸馏性能,在CIFAR-100和ImageNet基准测试中均持续优于当前最先进方法。

ABSTRACT

Knowledge distillation is a technique to enhance the generalization ability of a student model by exploiting outputs from a teacher model. Recently, feature-map based variants explore knowledge transfer between manually assigned teacher-student pairs in intermediate layers for further improvement. However, layer semantics may vary in different neural networks and semantic mismatch in manual layer associations will lead to performance degeneration due to negative regularization. To address this issue, we propose Semantic Calibration for cross-layer Knowledge Distillation (SemCKD), which automatically assigns proper target layers of the teacher model for each student layer with an attention mechanism. With a learned attention distribution, each student layer distills knowledge contained in multiple teacher layers rather than a specific intermediate layer for appropriate cross-layer supervision. We further provide theoretical analysis of the association weights and conduct extensive experiments to demonstrate the effectiveness of our approach. Code is avaliable at \url{https://github.com/DefangChen/SemCKD}.

研究动机与目标

  • 解决因人工指定教师-学生层对之间语义不匹配而导致的基于特征图知识蒸馏性能下降问题。
  • 克服固定且手工设计的层关联方式可能在学生模型训练过程中引发负正则化的问题。
  • 开发一种可学习的、灵活的跨层知识迁移机制,以对齐异构教师与学生网络之间的语义层级。
  • 通过自动层关联与特征图对齐,确保在多种网络架构和数据集上具备鲁棒且稳定的性能表现。
  • 证明与现有最先进蒸馏技术(如特征嵌入蒸馏)的兼容性,以实现进一步的性能提升。

提出的方法

  • 引入注意力机制,学习每个学生层与教师网络中多个目标层之间的软性关联权重,实现多层知识迁移。
  • 将学生特征图投影以匹配选定教师特征图的空间尺寸,确保层对之间损失计算的一致性。
  • 将层关联学习建模为可微分优化问题,并与正交普鲁斯特问题(Orthogonal Procrustes problem)建立理论联系,提升可解释性。
  • 将学习得到的注意力权重整合进蒸馏损失中,引导学生模型利用语义对齐的教师层知识。
  • 在学生训练过程中端到端应用该方法,实现模型参数与注意力权重的联合优化。
  • 通过与特征嵌入蒸馏(如CRD)结合,将框架扩展至混合蒸馏,验证了其高度兼容性与性能增益。

实验结果

研究问题

  • RQ1端到端可学习的注意力机制是否能有效替代跨层知识蒸馏中的人工层配对,从而减少语义不匹配?
  • RQ2所提出的语义校准机制相较于固定层分配,在特征图蒸馏中如何提升泛化能力?
  • RQ3所学习的注意力权重在层关联中的理论基础是什么?其与经典优化问题有何关联?
  • RQ4SemCKD在多种网络架构和数据集上的鲁棒性与泛化能力如何?
  • RQ5SemCKD能否与其它最先进蒸馏技术(如特征嵌入蒸馏)有效结合,以进一步提升性能?

主要发现

  • 在CIFAR-100上测试的全部12种网络组合中,SemCKD均实现了稳定的性能提升,优于包括CRD和KD在内的当前最先进方法。
  • 在VGG-8与ResNet-32x4组合上,SemCKD达到76.68%的top-1准确率,领先于次优方法超过1.5个百分点。
  • 该方法对超参数β具有强鲁棒性,在β > 400的广泛范围内均保持高性能,表明其稳定且易于使用。
  • 采用温度软化注意力的变体SemCKD τ进一步提升了性能,进一步扩大了与现有方法的领先优势。
  • 将SemCKD与CRD结合可在所有设置下带来额外的准确率增益,证实其与其它蒸馏技术具有高度兼容性。
  • 实验结果表明,语义校准能有效缓解因层对语义不匹配引发的负正则化问题,尤其在异构模型设置中效果显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。