Skip to main content
QUICK REVIEW

[论文解读] Show, Attend and Distill:Knowledge Distillation via Attention-based Feature Matching

Mingi Ji, Byeongho Heo|arXiv (Cornell University)|Feb 5, 2021
Advanced Graph Neural Networks被引用 8
一句话总结

本文提出了一种基于注意力的特征蒸馏(AFD)方法,该方法利用注意力机制自动识别并加权教师网络与学生网络之间的有效特征级连接,从而消除人工选择连接的需要。AFD通过基于学习到的特征相似性动态分配蒸馏强度,在模型压缩和迁移学习任务中实现了最先进性能,相较于L2T等先前方法,训练效率更高,且在多种架构上泛化能力更强。

ABSTRACT

Knowledge distillation extracts general knowledge from a pre-trained teacher network and provides guidance to a target student network. Most studies manually tie intermediate features of the teacher and student, and transfer knowledge through pre-defined links. However, manual selection often constructs ineffective links that limit the improvement from the distillation. There has been an attempt to address the problem, but it is still challenging to identify effective links under practical scenarios. In this paper, we introduce an effective and efficient feature distillation method utilizing all the feature levels of the teacher without manually selecting the links. Specifically, our method utilizes an attention-based meta-network that learns relative similarities between features, and applies identified similarities to control distillation intensities of all possible pairs. As a result, our method determines competent links more efficiently than the previous approach and provides better performance on model compression and transfer learning tasks. Further qualitative analyses and ablative studies describe how our method contributes to better distillation. The implementation code is available at github.com/clovaai/attention-feature-distillation.

研究动机与目标

  • 为解决知识蒸馏中人工选择特征连接所导致的局限性,此类方法常导致教师与学生网络之间连接次优或无效。
  • 开发一种方法,无需依赖昂贵的内层优化或孤立的门控机制,高效且有效地识别最具信息量的特征级连接。
  • 通过在所有可能的特征对之间利用基于注意力的相似性学习,提升模型压缩和迁移学习的性能。
  • 提供一种可扩展、高效且泛化能力强的替代方案,以应对现有基于元学习的蒸馏方法(如L2T)所面临的高计算成本和缺乏层间连接感知的问题。

提出的方法

  • 引入一种基于注意力的元网络,以计算教师与学生网络在多个层级上的特征图之间的成对相似性。
  • 注意力机制通过查询-键点积相似性计算,其中查询源自学生特征,键源自教师特征,从而实现蒸馏强度的动态加权。
  • 通过将注意力权重应用于特征级L2或余弦相似性损失来计算蒸馏损失,使模型能够聚焦于最相关的特征对。
  • 该方法在联合训练设置下运行,同时优化学生网络与基于注意力的蒸馏头,无需内层Hessian矩阵计算。
  • 注意力机制通过查询、键和值的投影实现,使用ReLU和恒等激活函数,并通过标准反向传播端到端训练。
  • 该方法与现有蒸馏技术(如CRD和RKD)兼容,可与之结合以进一步提升性能。

实验结果

研究问题

  • RQ1注意力机制是否能在无需人工干预的情况下,有效识别教师与学生网络之间最相关的特征级连接?
  • RQ2在蒸馏性能和计算效率方面,基于注意力的特征匹配与人工或门控连接方法相比表现如何?
  • RQ3注意力机制是否能提升在多样化网络架构及下游任务(如模型压缩和迁移学习)中的泛化能力?
  • RQ4该注意力方法如何处理架构差异,例如特征图尺寸或通道维度的不匹配?
  • RQ5超参数(如缩放因子β)对基于注意力的蒸馏过程稳定性与性能有何影响?

主要发现

  • 在CIFAR-100、tinyImageNet和ImageNet上的模型压缩任务中,AFD实现了最先进性能,优于人工连接与L2T-based蒸馏方法。
  • 在MIT67迁移学习基准上,AFD使用ResNet18作为学生网络时达到75.07%的准确率,超过L2T(74.85%)和ATT(72.54%),展现出更优的泛化能力。
  • 消融实验表明,AFD在教师与学生网络架构不同时,始终优于随机和有序连接策略。
  • 该方法在多种架构上表现出鲁棒性:在ResNet34 → WRN-28-2设置下,联合训练时准确率达到77.26%,优于有序连接的76.07%。
  • 敏感性分析表明,超参数β对性能有可测量但可控的影响,最优值位于一个狭窄且稳定的范围内。
  • 将AFD与CRD结合,相比单独使用AFD,准确率提升0.44个百分点,表明其与其它蒸馏技术兼容且具有叠加增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。