Skip to main content
QUICK REVIEW

[论文解读] Few Sample Knowledge Distillation for Efficient Network Compression

Tian-Hong Li, Jianguo Li|arXiv (Cornell University)|Dec 5, 2018
Advanced Neural Network Applications参考文献 39被引用 16
一句话总结

本文提出少样本知识蒸馏(FSKD),一种无需标签、数据效率高的深度神经网络压缩方法,仅使用1%的训练数据即可实现。通过在模块输出处添加并优化1×1卷积层,利用最小二乘回归对齐学生网络与教师网络的特征,FSKD在几分钟内即可恢复至微调水平的准确率,且无额外推理开销,优于现有蒸馏与微调方法在低数据场景下的表现。

ABSTRACT

Deep neural network compression techniques such as pruning and weight tensor decomposition usually require fine-tuning to recover the prediction accuracy when the compression ratio is high. However, conventional fine-tuning suffers from the requirement of a large training set and the time-consuming training procedure. This paper proposes a novel solution for knowledge distillation from label-free few samples to realize both data efficiency and training/processing efficiency. We treat the original network as "teacher-net" and the compressed network as "student-net". A 1x1 convolution layer is added at the end of each layer block of the student-net, and we fit the block-level outputs of the student-net to the teacher-net by estimating the parameters of the added layers. We prove that the added layer can be merged without adding extra parameters and computation cost during inference. Experiments on multiple datasets and network architectures verify the method's effectiveness on student-nets obtained by various network pruning and weight decomposition methods. Our method can recover student-net's accuracy to the same level as conventional fine-tuning methods in minutes while using only 1% label-free data of the full training data.

研究动机与目标

  • 解决在标签数据稀缺或不可用的高精度压缩、低数据场景下,传统微调方法效率低下的问题。
  • 在无需大规模标注数据集的前提下,实现剪枝或分解后学生网络的高效准确率恢复。
  • 开发一种训练高效且推理高效的压缩方法,最大限度减少计算与数据开销。
  • 证明该方法在多种网络架构和压缩技术(如剪枝、分解)中的适用性。
  • 实现在设备端或隐私保护场景下的模型压缩,仅需共享无标签数据。

提出的方法

  • 使用现有的剪枝或权重分解方法将教师网络压缩为学生网络,同时保持模块级特征图尺寸一致。
  • 在学生网络每个模块的末端添加可学习的1×1卷积层,以对齐其模块输出与教师网络的输出。
  • 利用少量无标签数据,通过最小二乘回归优化所添加的1×1卷积层参数,避免在整条学生网络上进行反向传播。
  • 证明所添加的1×1卷积层可在推理阶段与前序卷积层合并,而不会增加参数量或浮点运算量。
  • 采用块坐标下降法(BCD)优化1×1卷积层权重,相比标准SGD基蒸馏方法,收敛更快且所需样本更少。
  • 将该方法应用于自动压缩的学生网络(通过剪枝/分解生成)以及随机初始化的手动设计网络。

实验结果

研究问题

  • RQ1知识蒸馏是否能在仅使用1%完整训练数据、且蒸馏过程无标签的情况下,恢复压缩网络的准确率?
  • RQ2所提方法是否在显著更快且更高效利用数据的前提下,实现与完整微调相当的性能?
  • RQ3该方法是否能普遍适用于不同网络架构和压缩技术(如剪枝、分解)?
  • RQ4在低数据场景下,FSKD与现有蒸馏方法(如FitNet)相比表现如何?
  • RQ5当少量样本的类别分布与训练数据不同时,FSKD是否仍具有效性?

主要发现

  • FSKD 仅使用1%的标注训练数据且蒸馏过程无标签,即可将学生网络准确率恢复至与传统微调相当的水平。
  • 在CIFAR-10和CIFAR-100上,即使少量样本来自与训练数据不同的类别分布,FSKD仍能实现相近的准确率恢复,证明其无标签泛化能力。
  • 对于随机初始化的手动设计学生网络,FSKD优于SGD、[21]、[27]和FitNet,在MNIST上使用200个样本即可达到97.8%的准确率,超过FitNet的96.5%。
  • 由于仅对少量参数(即1×1卷积层)使用BCD优化,FSKD收敛速度更快、准确率更高,优于基于SGD的蒸馏方法。
  • FSKD通过将添加的1×1卷积层与前序层合并,保持了推理效率,确保无运行时开销。
  • 该方法在多个数据集(CIFAR-10、CIFAR-100、MNIST)和网络架构上均表现稳健,展现出广泛适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。