Skip to main content
QUICK REVIEW

[论文解读] Data Efficient Stagewise Knowledge Distillation

Akshay Kulkarni, Navid Panchi|arXiv (Cornell University)|Nov 15, 2019
Advanced Neural Network Applications参考文献 46被引用 5
一句话总结

本文提出分阶段知识蒸馏(Stagewise Knowledge Distillation, SKD),一种数据高效的方法,通过分阶段从预训练教师模型的中间特征图中蒸馏知识,逐步训练学生网络。通过每次仅优化较少的参数并充分利用完整数据的教师知识,SKD 即使仅使用 10%–40% 的训练数据,也能在图像分类和语义分割任务中超越传统知识蒸馏方法,实现更优性能。

ABSTRACT

Despite the success of Deep Learning (DL), the deployment of modern DL models requiring large computational power poses a significant problem for resource-constrained systems. This necessitates building compact networks that reduce computations while preserving performance. Traditional Knowledge Distillation (KD) methods that transfer knowledge from teacher to student (a) use a single-stage and (b) require the whole data set while distilling the knowledge to the student. In this work, we propose a new method called Stagewise Knowledge Distillation (SKD) which builds on traditional KD methods by progressive stagewise training to leverage the knowledge gained from the teacher, resulting in data-efficient distillation process. We evaluate our method on classification and semantic segmentation tasks. We show, across the tested tasks, significant performance gains even with a fraction of the data used in distillation, without compromising on the metric. We also compare our method with existing KD techniques and show that SKD outperforms them. Moreover, our method can be viewed as a generalized model compression technique that complements other model compression methods such as quantization or pruning.

研究动机与目标

  • 解决传统知识蒸馏在资源受限环境下数据和计算成本过高的问题。
  • 通过分阶段仅更新参数子集,降低学生训练过程中的过拟合和优化难度。
  • 通过利用教师模型的中间知识,实现在极小部分训练数据下的有效蒸馏。
  • 开发一种灵活、任务无关的压缩技术,可与剪枝、量化等现有方法互补。
  • 证明分阶段训练可提升分类和分割任务中的泛化能力与数据效率。

提出的方法

  • 学生网络以分阶段方式训练,每个阶段对应教师网络的一个特定中间特征图。
  • 在每个阶段,仅通过学生输出与教师特征图之间的均方误差(MSE)损失,更新对应的学生产层。
  • 最终分类头直接使用真实标签通过交叉熵损失进行训练,与教师模型无关。
  • 该方法从教师网络的浅层逐步向深层推进,确保知识逐步吸收。
  • 该方法在任一阶段均减少可训练参数数量,降低优化复杂度和过拟合风险。
  • 该方法与标准训练流程兼容,可与量化、剪枝等其他压缩技术结合使用。

实验结果

研究问题

  • RQ1通过分阶段而非一次性训练学生模型,能否使知识蒸馏更具数据效率?
  • RQ2与传统的端到端知识蒸馏相比,分阶段训练是否能降低过拟合和优化难度?
  • RQ3当仅使用少量训练数据时,SKD 能在多大程度上保持或提升学生模型性能?
  • RQ4在不同任务中,SKD 与现有知识蒸馏方法相比,在准确率和数据效率方面表现如何?
  • RQ5SKD 能否在图像分类和语义分割等多样化视觉任务中实现泛化?

主要发现

  • SKD 即使仅使用 10% 的训练数据,也能在图像分类和语义分割任务中实现显著性能提升,优于基线知识蒸馏方法。
  • 在 CamVid 数据集的语义分割任务中,SKD 使用 10% 数据的性能超过了使用 40% 数据但无教师模型的模型,展现出强大的数据效率。
  • 在图像分类任务中,SKD 表现优于传统知识蒸馏和同时蒸馏基线方法,在分割任务中最小实现 5% 的 IoU 提升,且在分类任务中保持一致的准确率提升。
  • 该方法通过限制每阶段更新的参数数量,有效降低了小模型的过拟合风险,尤其在 30%–40% 数据设置下,大尺寸学生模型(如 ResNet26)在基线方法中出现明显过拟合。
  • 分阶段训练实现了更好的泛化能力,随着学生模型容量增大,性能持续提升,表明对过拟合的敏感性降低。
  • 该方法在各类任务中均表现稳健,可与其它压缩技术结合,表明其是一种通用的模型压缩框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。