[论文解读] Students are the Best Teacher: Exit-Ensemble Distillation with Multi-Exits
本文提出了一种名为退出集成蒸馏(Exit-Ensemble Distillation, EED)的知识蒸馏方法,该方法在卷积神经网络(CNN)中引入多个辅助分类器(退出点),作为动态的、自监督的教师集成模型,以提升分类性能,且无需依赖预训练教师模型。通过实现双向知识迁移——即退出点指导主网络,同时主网络也引导退出点——该方法在多种网络架构上实现了最先进(SOTA)的准确率提升,同时具备更快的收敛速度和更优的特征学习能力。
This paper proposes a novel knowledge distillation-based learning method to improve the classification performance of convolutional neural networks (CNNs) without a pre-trained teacher network, called exit-ensemble distillation. Our method exploits the multi-exit architecture that adds auxiliary classifiers (called exits) in the middle of a conventional CNN, through which early inference results can be obtained. The idea of our method is to train the network using the ensemble of the exits as the distillation target, which greatly improves the classification performance of the overall network. Our method suggests a new paradigm of knowledge distillation; unlike the conventional notion of distillation where teachers only teach students, we show that students can also help other students and even the teacher to learn better. Experimental results demonstrate that our method achieves significant improvement of classification performance on various popular CNN architectures (VGG, ResNet, ResNeXt, WideResNet, etc.). Furthermore, the proposed method can expedite the convergence of learning with improved stability. Our code will be available on Github.
研究动机与目标
- 消除知识蒸馏中对预训练教师模型的依赖。
- 通过一种新颖的蒸馏范式,提升标准CNN(如VGG、ResNet)的分类准确率。
- 探究多退出架构中的辅助退出点是否可在自蒸馏框架中同时充当学生与教师。
- 分析集成多样性与信号质量对蒸馏性能的影响。
- 评估所提出训练过程相较于标准交叉熵训练的稳定性与收敛速度。
提出的方法
- 提出一种多退出CNN架构,在中间层插入辅助分类器(退出点)。
- 将所有退出点与最终输出的集成作为动态的、自生成的教师信号用于蒸馏。
- 在每个退出点与集成目标之间、以及主网络与集成之间应用知识蒸馏损失。
- 采用联合损失函数:在所有退出点和主网络上使用标准交叉熵损失,同时在蒸馏损失中使用集成生成的软标签。
- 将每个退出点和主网络均视为双向蒸馏循环中的学生与教师。
- 在蒸馏损失中使用温度缩放,以平滑logits并提升知识迁移效果。
实验结果
研究问题
- RQ1在多退出CNN中,一个自监督的退出点集成能否在无需预训练模型的情况下作为有效的教师?
- RQ2当退出点与主网络之间实现双向知识蒸馏(即相互指导)时,其分类准确率是否优于单向蒸馏?
- RQ3集成教师信号的多样性和质量如何影响性能增益?
- RQ4EED在多大程度上改善了特征学习,特别是对类别特定表征的提升?
- RQ5与标准交叉熵训练相比,该方法是否能稳定训练过程并加速收敛?
主要发现
- EED在多个架构(VGG、ResNet、ResNeXt、WideResNet)上于CIFAR-100和ImageNet数据集上均实现了最先进(SOTA)的准确率,优于以往的蒸馏方法。
- 在训练过程中,退出点的集成始终比仅使用主网络的准确率更高,验证了教师信号的有效性。
- 采用EED训练的主网络学习到了更清晰、更具判别力的类别特定表征,表现为表示差异矩阵中出现块对角模式。
- EED显著稳定了训练过程,减少了标准交叉熵训练中常见的性能波动,并加速了收敛。
- 该方法通过鼓励类内特征表示高度相关而类间表示不相关,从而提升了泛化能力。
- 将主网络纳入集成教师至关重要——若将其排除,则性能增益微乎其微,表明信号质量与多样性同等重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。