Skip to main content
QUICK REVIEW

[论文解读] Preparing Lessons: Improve Knowledge Distillation with Better Supervision

Tiancheng Wen, Shenqi Lai|arXiv (Cornell University)|Nov 18, 2019
Advanced Neural Network Applications参考文献 51被引用 20
一句话总结

本文提出知识调节(KA)与动态温度蒸馏(DTD),通过解决教师模型错误及过度不确定的监督问题,提升知识蒸馏性能。KA 利用真实标签纠正教师预测中的误分类样本,DTD 则通过样本特定的温度缩放降低软标签的不确定性,结合其他 KD 方法后,在 CIFAR-100、CINIC-10 和 Tiny ImageNet 上实现最先进性能。

ABSTRACT

Knowledge distillation (KD) is widely used for training a compact model with the supervision of another large model, which could effectively improve the performance. Previous methods mainly focus on two aspects: 1) training the student to mimic representation space of the teacher; 2) training the model progressively or adding extra module like discriminator. Knowledge from teacher is useful, but it is still not exactly right compared with ground truth. Besides, overly uncertain supervision also influences the result. We introduce two novel approaches, Knowledge Adjustment (KA) and Dynamic Temperature Distillation (DTD), to penalize bad supervision and improve student model. Experiments on CIFAR-100, CINIC-10 and Tiny ImageNet show that our methods get encouraging performance compared with state-of-the-art methods. When combined with other KD-based methods, the performance will be further improved.

研究动机与目标

  • 解决知识蒸馏中教师模型产生错误或过度不确定预测所导致的不良监督问题。
  • 通过优化教师网络提供的监督质量,提升学生模型的性能。
  • 通过更结构化的软标签减少遗传错误并增强模型判别能力。
  • 开发适用于广泛场景且与现有 KD 框架兼容的方法。
  • 探究纠正教师错误并降低不确定性是否能在多种数据集上带来一致的性能提升。

提出的方法

  • 知识调节(KA)在损失计算前,通过用真实标签替换误分类样本的教师预测结果,修正教师预测。
  • KA 提供两种实现方式:一种为硬标签修正,另一种为标签正则化,两者均确保监督的正确性。
  • 动态温度蒸馏(DTD)引入样本级温度缩放,以降低教师模型产生的软目标中的不确定性。
  • DTD 根据预测置信度动态调整每个样本的温度,促进生成更具判别性的软标签。
  • 该方法采用可微分公式计算自适应温度的软目标,提升训练稳定性。
  • KA 与 DTD 均兼容标准 KD 方法,可与 AT 和 NST 等其他蒸馏技术结合使用。

实验结果

研究问题

  • RQ1教师模型的错误监督在知识蒸馏中如何影响学生模型的性能?
  • RQ2纠正教师预测错误在多大程度上能提升学生模型的泛化能力并减少遗传错误?
  • RQ3动态温度缩放是否能降低软标签的不确定性并提升学生模型的判别能力?
  • RQ4当 KA 与 DTD 与其他基于 KD 的方法结合时,其性能表现如何?
  • RQ5监督质量是否显著影响异构教师-学生设置下的蒸馏性能?

主要发现

  • KA 与 DTD 独立地提升了在 CIFAR-100、CINIC-10 和 Tiny ImageNet 上的准确率,且 DTD-KA 实现了最先进性能。
  • 在 Tiny ImageNet 上,DTD-KA 达到最高 top-1 准确率,并显著减少遗传错误,优于其他方法。
  • 将 KA 与 DTD 与 AT 和 NST 等现有方法结合,进一步提升了性能,表明其具有强大兼容性。
  • 该方法显著减少了遗传错误,尤其在 Tiny ImageNet 上表现突出,表明该数据集存在更高比例的教师误分类样本。
  • 实验表明,近一半的学生错误源于教师的错误预测,验证了监督校正的必要性。
  • DTD 通过按样本自适应调整温度,有效缓解了软标签中的不确定性,从而提供更可靠的监督。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。