Skip to main content
QUICK REVIEW

[论文解读] Data-Free Knowledge Distillation with Soft Targeted Transfer Set Synthesis

Zi Wang|arXiv (Cornell University)|Apr 10, 2021
Advanced Neural Network Applications参考文献 37被引用 4
一句话总结

本文提出了一种无需原始训练数据的知识蒸馏方法,通过使用多元正态分布建模教师网络的中间特征空间,生成高质量的伪训练样本,并用于噪声优化的软目标。该方法在不使用任何原始训练数据的情况下,实现了最先进的性能——在MNIST上达到99.08%的准确率,在CIFAR-10上达到93.31%的准确率,通过利用来自浅层网络的更通用、抗标签错配的软目标,优于以往的数据无关知识蒸馏方法。

ABSTRACT

Knowledge distillation (KD) has proved to be an effective approach for deep neural network compression, which learns a compact network (student) by transferring the knowledge from a pre-trained, over-parameterized network (teacher). In traditional KD, the transferred knowledge is usually obtained by feeding training samples to the teacher network to obtain the class probabilities. However, the original training dataset is not always available due to storage costs or privacy issues. In this study, we propose a novel data-free KD approach by modeling the intermediate feature space of the teacher with a multivariate normal distribution and leveraging the soft targeted labels generated by the distribution to synthesize pseudo samples as the transfer set. Several student networks trained with these synthesized transfer sets present competitive performance compared to the networks trained with the original training set and other data-free KD approaches.

研究动机与目标

  • 解决因隐私或存储限制导致原始训练数据不可用时知识蒸馏的挑战。
  • 通过建模中间特征表示而非直接建模Softmax输出,提升数据无关知识蒸馏中合成迁移集的质量。
  • 减少以往方法中在Softmax空间使用如Dirichlet分布时常见的标签错配问题。
  • 通过从浅层高阶特征空间中提取更通用的软目标,提升学生网络的性能。
  • 在多种架构和基准数据集上验证所提方法的有效性。

提出的方法

  • 使用多元正态分布对教师网络中间层(如FC-2)的输出进行建模,以捕捉特征分布。
  • 从该多元正态分布中采样软目标标签,以指导伪训练图像的生成。
  • 通过反向传播优化随机噪声输入,使其在教师网络前向传播结果与采样软目标之间的距离最小化。
  • 将优化后的伪样本作为迁移集,通过标准知识蒸馏与蒸馏损失训练学生网络。
  • 引入额外的激活损失,以鼓励更高的神经元激活,从而提升合成样本的质量。
  • 利用t-SNE可视化比较多元正态分布与Dirichlet分布生成的软目标在聚类质量上的差异。

实验结果

研究问题

  • RQ1是否可以通过使用多元正态分布对教师网络的中间特征空间进行建模,来提升数据无关知识蒸馏中合成伪样本的质量?
  • RQ2与建模最终Softmax层相比,使用来自浅层特征层的软目标是否能带来更好的泛化性和学生模型性能?
  • RQ3以往方法中在Softmax输出上使用Dirichlet分布所导致的标签错配问题如何影响性能?该问题能否被缓解?
  • RQ4添加激活损失在多大程度上能改善伪样本的优化过程以及最终学生模型的准确率?
  • RQ5在不同数据集和架构下,所提方法与现有数据无关知识蒸馏方法相比,在准确率和鲁棒性方面表现如何?

主要发现

  • 所提方法仅使用教师网络且不依赖任何原始训练数据,在MNIST上达到99.08%的测试准确率,在CIFAR-10上达到93.31%的准确率,优于现有数据无关知识蒸馏方法。
  • 与建模Softmax层相比,对倒数第二层全连接层(FC-2)的特征空间进行建模,使LeNet-5-HALF的准确率提升0.12%,AlexNet-HALF的准确率提升1.59%。
  • 多元正态分布生成的软目标比Dirichlet分布更一致且聚类更清晰,通过避免按类别采样导致的错位,有效缓解了标签错配问题。
  • 引入激活损失进一步提升了性能,但增益小于特征空间建模带来的提升,表明特征空间建模是方法成功的主要贡献因素。
  • t-SNE可视化结果表明,来自多元正态分布的软目标聚类更清晰、更可分,支持了更优的样本生成。
  • 该方法在多种架构和数据集上均表现出一致的性能提升,验证了其在数据无关知识蒸馏场景下的泛化能力与鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。