[论文解读] Residual Knowledge Distillation
本文提出残差知识蒸馏(Residual Knowledge Distillation, RKD),一种新颖的模型压缩方法,通过引入一个辅助模型来学习学生模型与教师模型特征图之间的残差误差,从而提升知识蒸馏的效果。通过将单一学生模型拆分为学生模型与轻量级辅助模型,且不增加计算成本,RKD 实现了当前最优性能,在 ImageNet 上将 ResNet-18 的准确率相比先前方法提升了 2.0%。
Knowledge distillation (KD) is one of the most potent ways for model compression. The key idea is to transfer the knowledge from a deep teacher model (T) to a shallower student (S). However, existing methods suffer from performance degradation due to the substantial gap between the learning capacities of S and T. To remedy this problem, this work proposes Residual Knowledge Distillation (RKD), which further distills the knowledge by introducing an assistant (A). Specifically, S is trained to mimic the feature maps of T, and A aids this process by learning the residual error between them. In this way, S and A complement with each other to get better knowledge from T. Furthermore, we devise an effective method to derive S and A from a given model without increasing the total computational cost. Extensive experiments show that our approach achieves appealing results on popular classification datasets, CIFAR-100 and ImageNet, surpassing state-of-the-art methods.
研究动机与目标
- 解决因学生模型容量有限而导致的学生与教师模型之间性能差距的问题。
- 通过引入两阶段蒸馏过程,而非依赖单一的一对一模仿,提升知识迁移效率。
- 开发一种模型分离技术,实现在不增加总 FLOPs 的前提下,将计算资源在学生与辅助模型之间进行分配。
- 通过实证验证,轻量级辅助模型能够有效学习残差误差,并显著提升学生模型性能。
- 通过与 AT 等其他蒸馏方法结合,展示 RKD 的泛化潜力。
提出的方法
- 该方法引入一个辅助模型 A,用于学习学生 S 与教师 T 的特征图之间的残差误差。
- 最终的学生模型输出由 S 和 A 的特征图相加而成,从而实现与教师输出的更好对齐。
- 提出一种模型分离技术,从单一模型中推导出 S 和 A,确保总 FLOPs 不变。
- 辅助模型 A 的训练目标是最小化其输出与 T 和 S 特征图之间差异(残差)的 L2 损失。
- 该方法兼容多种知识类型,包括特征图和注意力图,只要能定义残差误差即可。
- 通过训练 S 模仿 T,同时 A 学习残差误差,实现更好的泛化与准确率。
实验结果
研究问题
- RQ1引入一个学习学生与教师特征图之间残差误差的辅助模型,能否提升知识蒸馏的性能?
- RQ2RKD 中的两阶段蒸馏过程是否能减少因学生与教师模型容量差距导致的性能退化?
- RQ3轻量级辅助模型是否能在不增加总计算成本的前提下实现显著的性能提升?
- RQ4RKD 在多种数据集上与当前最优知识蒸馏方法(如 KD、FitNets 和 AT)相比表现如何?
- RQ5RKD 是否能泛化应用于其他蒸馏策略,如注意力蒸馏(AT)?
主要发现
- 在将知识从 ResNet-34 蒸馏到 ResNet-18 时,RKD 在 ImageNet 上实现了 2.0% 的 top-1 准确率提升,相比第二好的方法高出 1.2%,表现显著更优。
- 在 CIFAR-100 上,RKD 相比基线 KD 方法将学生模型准确率提升了 2.75%,并更接近教师模型的性能。
- 使用仅占学生模型 6.25% 计算成本的轻量级辅助模型(ResNet-18-1/4),RKD 实现了 0.87% 的更高准确率,展现出卓越的效率。
- 即使辅助模型与教师模型一样大(ResNet-34),性能也未达到教师水平,表明轻量级 A 模型已足够且最优。
- RKD 与 AT 结合后在 ImageNet 上实现了 71.54% 的 top-1 准确率,表明残差学习策略可良好泛化至其他蒸馏方法。
- 在 CIFAR-100 上的可视化结果表明,由于有效学习了残差误差,RKD 生成的特征图比基线方法更具判别性,尤其在早期网络块中表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。