Skip to main content
QUICK REVIEW

[论文解读] A Comprehensive Overhaul of Feature Distillation

Byeongho Heo, Jeesoo Kim|arXiv (Cornell University)|Apr 3, 2019
Advanced Neural Network Applications参考文献 28被引用 12
一句话总结

该论文提出了一种新颖的特征蒸馏方法,通过重新思考关键设计要素来增强知识迁移:使用带有边距的ReLU对教师特征进行变换,蒸馏ReLU激活前的特征,并采用部分L2距离函数以忽略无信息的负样本特征。该方法在使用ResNet50学生网络时,在ImageNet上实现了21.65%的top-1错误率,甚至优于ResNet152教师网络,且在分类、检测和分割任务中均优于当前最先进方法。

ABSTRACT

We investigate the design aspects of feature distillation methods achieving network compression and propose a novel feature distillation method in which the distillation loss is designed to make a synergy among various aspects: teacher transform, student transform, distillation feature position and distance function. Our proposed distillation loss includes a feature transform with a newly designed margin ReLU, a new distillation feature position, and a partial L2 distance function to skip redundant information giving adverse effects to the compression of student. In ImageNet, our proposed method achieves 21.65% of top-1 error with ResNet50, which outperforms the performance of the teacher network, ResNet152. Our proposed method is evaluated on various tasks such as image classification, object detection and semantic segmentation and achieves a significant performance improvement in all tasks. The code is available at https://sites.google.com/view/byeongho-heo/overhaul

研究动机与目标

  • 研究并改进特征蒸馏方法的设计,以实现更优的网络压缩与性能提升。
  • 解决现有蒸馏方法因信息丢失或特征表示不理想而导致性能下降的局限性。
  • 识别教师与学生网络变换、蒸馏位置以及距离函数的最优配置。
  • 证明基于边距损失与部分距离函数蒸馏ReLU前特征可显著提升学生网络性能。
  • 在图像分类、目标检测与语义分割等多种任务上验证该方法的有效性。

提出的方法

  • 引入带边距的ReLU函数作为教师网络的变换,以保留有意义的特征边界并减少负值带来的噪声。
  • 将蒸馏位置前移至ReLU激活之前,以传输正负特征响应,提升激活模式的模仿能力。
  • 提出一种部分L2距离函数,排除低于小边距的负特征值,避免传递无信息或有害信息。
  • 采用1×1卷积作为学生网络的变换,以对齐特征维度并保持表征一致性。
  • 在训练模式下使用批量归一化对教师网络进行处理,实验证明可显著提升性能。
  • 在整个训练过程中持续应用蒸馏,确保稳定且高效的知識迁移。

实验结果

研究问题

  • RQ1蒸馏位置(ReLU前或后)如何影响知识迁移性能?
  • RQ2修改蒸馏损失函数以排除负特征值会产生何种影响?
  • RQ3在教师网络中使用带边距的ReLU是否能通过保留激活边界来改善蒸馏效果?
  • RQ4批量归一化模式选择(训练模式 vs. 评估模式)对蒸馏性能有何影响?
  • RQ5重新设计的蒸馏流程在多任务场景下能多大程度上超越现有最先进方法?

主要发现

  • 所提方法在使用ResNet50学生网络时,于ImageNet上实现21.65%的top-1错误率,优于具有78.31%准确率的ResNet152教师网络。
  • 该方法在所有评估任务中均显著提升性能:图像分类(CIFAR-100、ImageNet)、目标检测(PASCAL VOC)与语义分割(PASCAL VOC)。
  • 消融实验表明,ReLU前蒸馏带来的性能增益最大(错误率降低1.56%),其次为基于边距的损失函数与批量归一化模式选择。
  • 部分L2距离函数能有效抑制无信息负特征的传递,提升泛化能力并减少噪声。
  • 与先前的连续蒸馏方法相比,该方法能更有效地降低学生与教师输出之间的KL散度,表明其对教师网络的模仿能力更强。
  • 教师网络中使用训练模式下的批量归一化带来了显著的性能提升,尤其对本方法而言,凸显其在蒸馏过程中的关键作用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。