[论文解读] Knowledge Distillation with Feature Maps for Image Classification
本文提出KDFM,一种知识蒸馏方法,通过使用共享分类器和生成对抗网络(GANs)从教师网络迁移特征图,从而提升学生模型的性能。实验表明,KDFM使一个4层卷积神经网络(CNN)在推理速度提升2倍的同时,准确率可达到DenseNet-40的水平;同时,MobileNet在CIFAR-100数据集上实现了77.20%的准确率,推理速度比DenseNet-100快6倍,模型大小减少一半。
The model reduction problem that eases the computation costs and latency of complex deep learning architectures has received an increasing number of investigations owing to its importance in model deployment. One promising method is knowledge distillation (KD), which creates a fast-to-execute student model to mimic a large teacher network. In this paper, we propose a method, called KDFM (Knowledge Distillation with Feature Maps), which improves the effectiveness of KD by learning the feature maps from the teacher network. Two major techniques used in KDFM are shared classifier and generative adversarial network. Experimental results show that KDFM can use a four layers CNN to mimic DenseNet-40 and use MobileNet to mimic DenseNet-100. Both student networks have less than 1\% accuracy loss comparing to their teacher models for CIFAR-100 datasets. The student networks are 2-6 times faster than their teacher models for inference, and the model size of MobileNet is less than half of DenseNet-100's.
研究动机与目标
- 为解决在移动设备和物联网系统等资源受限设备上部署大型、计算成本高昂的深度学习模型的挑战。
- 通过利用中间特征图而非仅输出logits,改进知识蒸馏,实现更有效的知识迁移。
- 开发一种方法,使简单、浅层且宽广的学生网络能够达到像DenseNet这样的复杂深层教师网络的性能。
- 通过对抗训练增强蒸馏效果,使学生网络的特征图与教师网络对齐。
- 证明所提方法在不同架构和数据集(包括CIFAR-100和ImageNet)上的泛化能力。
提出的方法
- KDFM在教师网络和学生网络之间使用共享分类器,以在训练过程中对齐特征表示。
- 采用生成对抗网络(GAN)框架,其中学生网络作为生成器,教师网络的特征图作为真实数据。
- GAN中的判别器被训练以区分来自教师网络的真实特征图与来自学生网络的生成特征图,从而迫使学生网络生成更逼真的特征图。
- 损失函数结合了logits上的知识蒸馏损失和特征图上的对抗损失,以提升泛化能力。
- 该方法应用于浅层且宽广的学生网络(例如4-8层卷积层),这类网络比深层细长网络更易于硬件加速。
- 该框架在多个教师模型(DenseNet-40、DenseNet-100、CondenseNet-86、ResNet-152)和学生架构(简单CNN、MobileNet)上进行了评估。
实验结果
研究问题
- RQ1与仅蒸馏logits相比,蒸馏中间特征图是否能显著提升知识蒸馏中学生模型的性能?
- RQ2基于GAN的框架在图像分类任务中,对对齐教师与学生网络的特征图是否具有显著效果?
- RQ3一个简单、浅层且宽广的学生网络能否实现与DenseNet-100等深层复杂教师网络相当的性能?
- RQ4结合共享分类器与在特征图上进行对抗训练,是否能比标准知识蒸馏方法带来更高的准确率和更快的推理速度?
- RQ5KDFM是否能在不同数据集(CIFAR-100、ImageNet)和模型架构上实现泛化?
主要发现
- 当模仿DenseNet-40时,4层卷积神经网络(CNN)学生模型在CIFAR-100数据集上达到74.23%的准确率,准确率下降不足1%,且推理速度提升2倍。
- 当使用KDFM模仿DenseNet-100时,MobileNet在CIFAR-100上达到77.20%的准确率,仅比教师网络低0.74%,同时推理速度提升6倍,模型参数量不足DenseNet-100的一半。
- 在ImageNet数据集上,使用KDFM训练的MobileNet v2达到71.82%的top-1准确率,优于标准知识蒸馏方法(70.16%)和基线模型(68.01%)。
- 消融实验表明,若移除对抗损失组件,准确率降至71.32%,证实其在提升特征图对齐方面的重要性。
- 即使参数量仅为2020万或2810万的简单CNN,经KDFM训练后,准确率分别达到74.36%和75.25%,优于无知识蒸馏的基线模型。
- 该方法在架构间表现出良好的泛化能力:使用KDFM训练的CondenseNet-86学生模型在CIFAR-100上的准确率从74.13%提升至75.01%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。