[论文解读] Knowledge Distillation Based on Transformed Teacher Matching
本文提出了一种名为变换教师匹配(Transformed Teacher Matching, TTM)的知识蒸馏方法,该方法从学生网络中移除了温度缩放,引入了一种固有的Rényi熵正则化项,从而提升了泛化能力。此外,本文还提出了加权TTM(WTTM),这是一种样本自适应的变体,可进一步提升匹配精度,在ImageNet上实现了SOTA性能,使用ResNet-34蒸馏ResNet-18时达到72.19%的top-1准确率。
As a technique to bridge logit matching and probability distribution matching, temperature scaling plays a pivotal role in knowledge distillation (KD). Conventionally, temperature scaling is applied to both teacher's logits and student's logits in KD. Motivated by some recent works, in this paper, we drop instead temperature scaling on the student side, and systematically study the resulting variant of KD, dubbed transformed teacher matching (TTM). By reinterpreting temperature scaling as a power transform of probability distribution, we show that in comparison with the original KD, TTM has an inherent Rényi entropy term in its objective function, which serves as an extra regularization term. Extensive experiment results demonstrate that thanks to this inherent regularization, TTM leads to trained students with better generalization than the original KD. To further enhance student's capability to match teacher's power transformed probability distribution, we introduce a sample-adaptive weighting coefficient into TTM, yielding a novel distillation approach dubbed weighted TTM (WTTM). It is shown, by comprehensive experiments, that although WTTM is simple, it is effective, improves upon TTM, and achieves state-of-the-art accuracy performance. Our source code is available at https://github.com/zkxufo/TTM.
研究动机与目标
- 探究在知识蒸馏中是否应对教师和学生均应用温度缩放。
- 理解从学生网络中移除温度缩放所带来的理论与实证影响。
- 开发一种更有效的蒸馏方法,通过内在正则化提升泛化能力与匹配精度。
- 提出一种样本自适应的加权机制,以在TTM基础上进一步提升教师-学生概率分布的匹配效果。
提出的方法
- TTM从学生logits中移除了温度缩放,重新表述知识蒸馏目标,以最小化交叉熵损失与KL散度,即温度缩放后的教师输出与未归一化的学生输出之间的差异。
- 该方法将温度缩放重新解释为概率分布的幂变换,揭示出TTM在其目标函数中天然包含一个Rényi熵正则化项。
- WTTM引入了一个样本自适应的加权系数 $ U_{1/T}(p^t) $,可基于教师输出的概率分布置信度与温度动态调整教师分布的影响。
- TTM中的平衡权重 $ \beta $ 被设定为与标准KD中保持相同的相对损失比例,以确保公平比较。
- 理论分析表明,从学生网络中移除温度缩放会引入正则化效应,从而提升泛化能力。
- WTTM在保持与标准KD相近的计算复杂度的同时,通过自适应匹配显著提升了性能。
实验结果
研究问题
- RQ1仅对教师应用温度缩放而对学生不应用,是否能在知识蒸馏中带来更好的泛化性能?
- RQ2该变体性能提升的理论机制是什么?与标准KD有何不同?
- RQ3样本自适应的加权策略是否能进一步增强学生与变换后教师分布之间的匹配?
- RQ4TTM中固有的Rényi熵正则化项如何影响学生预测的平滑性与泛化能力?
主要发现
- TTM由于从学生网络中移除温度缩放而引入了固有的Rényi熵正则化项,其泛化能力优于标准KD。
- 使用TTM训练的学生模型在输出分布上的平均Shannon熵显著更高,表明其预测更加平滑且鲁棒。
- WTTM在性能上优于KD与TTM,在从ResNet-34蒸馏ResNet-18时,ImageNet上的top-1准确率达到72.19%,超越了大多数复杂的基于特征的蒸馏方法。
- 即使不使用交叉熵损失,WTTM的性能仍优于使用相同损失的KD,证明了其鲁棒性与强大的归纳偏置。
- 随着教师模型性能的提升,WTTM下学生模型的性能持续提高并超越其他方法,表明其具有出色的可扩展性。
- 在WTTM中,平均KL散度 $ D(p^t_T || q) $ 下降得更快且达到更低的值,证实了其对变换后教师分布的匹配更加准确。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。