Skip to main content
QUICK REVIEW

[论文解读] Knowledge distillation via adaptive instance normalization

Jing Yang, Brais Martínez|arXiv (Cornell University)|Mar 9, 2020
Generative Adversarial Networks and Image Synthesis参考文献 43被引用 16
一句话总结

本文提出了一种新颖的知识蒸馏方法,通过自适应实例归一化(AdaIN)将教师网络的通道级特征统计量(均值与方差)传递至学生网络。通过引入教师对统计量可靠性的反馈机制,使学生网络的统计量得到优化,该方法在多种架构、数据集和领域中均实现了最先进性能,包括在ImageNet和CIFAR-100上的真实值到二值化网络的蒸馏任务。

ABSTRACT

This paper addresses the problem of model compression via knowledge distillation. To this end, we propose a new knowledge distillation method based on transferring feature statistics, specifically the channel-wise mean and variance, from the teacher to the student. Our method goes beyond the standard way of enforcing the mean and variance of the student to be similar to those of the teacher through an $L_2$ loss, which we found it to be of limited effectiveness. Specifically, we propose a new loss based on adaptive instance normalization to effectively transfer the feature statistics. The main idea is to transfer the learned statistics back to the teacher via adaptive instance normalization (conditioned on the student) and let the teacher network "evaluate" via a loss whether the statistics learned by the student are reliably transferred. We show that our distillation method outperforms other state-of-the-art distillation methods over a large set of experimental settings including different (a) network architectures, (b) teacher-student capacities, (c) datasets, and (d) domains.

研究动机与目标

  • 解决标准L2损失在知识蒸馏过程中传递特征统计量时的局限性。
  • 通过实现教师到学生网络间更有效的通道级均值与方差传递,提升模型压缩效果。
  • 设计一种反馈机制,使教师网络评估所传递统计量的可靠性,从而提升学习效率。
  • 在不同网络架构、教师-学生参数量比、数据集(CIFAR-10/100、ImageNet)和领域(实值网络到二值化网络)等多种设置下,持续实现性能提升。

提出的方法

  • 提出一种基于自适应实例归一化(AdaIN)的新损失函数,将学生网络学习到的通道级均值与方差反馈回教师网络。
  • 使用学生网络的统计量作为缩放与位移参数,对教师网络的特征图应用实例归一化。
  • 训练学生网络,使其最小化经过调整后的教师输出与原始教师输出之间的L2损失,确保传递的统计量不会降低性能。
  • 利用教师网络提供的反馈信号来监督学生网络,形成一种自校正的统计量传递机制。
  • 将所提损失与标准蒸馏目标(如logits上的KL散度)联合优化。
  • 在训练过程中端到端应用该方法,仅更新学生网络,而教师网络在推理时保持固定。

实验结果

研究问题

  • RQ1能否通过将教师网络的通道级特征统计量(均值与方差)传递给学生网络,使知识蒸馏性能超越标准L2损失?
  • RQ2是否可通过自适应实例归一化构建从学生到教师的反馈回路,从而提升统计量传递的可靠性和有效性?
  • RQ3所提方法在多种网络架构和数据集领域中,与现有最先进蒸馏技术相比表现如何?
  • RQ4该方法能否在真实值到二值化神经网络蒸馏等具有挑战性的设置中有效传递知识?
  • RQ5通过教师评估构建的反馈机制是否能提升泛化能力与性能,优于标准蒸馏损失?

主要发现

  • 在从ResNet-34(21.8M参数)蒸馏到ResNet-18(11.69M参数)的设置下,该方法在ImageNet-1K上实现了71.82%的top-1准确率,优于所有基线方法,包括CRD与RKD。
  • 在相同设置下,该方法将教师与学生之间的准确率差距缩小了2.36%,而CRD仅为1.27%,表明其性能增益更优。
  • 在从ResNet-50(25.56M参数)蒸馏到MobileNet(4.23M参数)的设置下,该方法实现了72.49%的top-1准确率,领先第二好的方法CRD(71.40%)1.09个百分点。
  • 在CIFAR-100上的真实值到二值化网络蒸馏任务中,该方法使用ResNet-34作为教师、二值化学生网络,实现了70.15%的top-1准确率,领先次优方法OFD 2.39个百分点。
  • 在ImageNet-1K上使用二值化学生网络时,该方法实现了70.20%的top-1准确率,显著优于KD(56.70%)、AT(58.45%)与CRD(58.25%)。
  • 该方法在所有评估设置中均持续提升性能,涵盖不同架构、数据集规模与领域,展现出强大的泛化能力与可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。