Skip to main content
QUICK REVIEW

[论文解读] An Empirical Analysis of the Impact of Data Augmentation on Knowledge Distillation

Deepan Das, Haley Massa|arXiv (Cornell University)|Jun 6, 2020
Privacy-Preserving Technologies in Data参考文献 37被引用 13
一句话总结

本文研究了数据增强策略——尤其是混合样本方法如MixUp和CutMix——对知识蒸馏的影响。研究发现,尽管这些技术提升了教师模型的泛化能力,但通过新颖的类别区分度度量和潜在空间表征分析表明,它们会因扭曲监督信号而损害学生模型的表现。

ABSTRACT

Generalization Performance of Deep Learning models trained using Empirical Risk Minimization can be improved significantly by using Data Augmentation strategies such as simple transformations, or using Mixed Samples. We attempt to empirically analyze the impact of such strategies on the transfer of generalization between teacher and student models in a distillation setup. We observe that if a teacher is trained using any of the mixed sample augmentation strategies, such as MixUp or CutMix, the student model distilled from it is impaired in its generalization capabilities. We hypothesize that such strategies limit a model's capability to learn example-specific features, leading to a loss in quality of the supervision signal during distillation. We present a novel Class-Discrimination metric to quantitatively measure this dichotomy in performance and link it to the discriminative capacity induced by the different strategies on a network's latent space.

研究动机与目标

  • 研究数据增强对知识蒸馏的影响,特别是混合样本策略如MixUp和CutMix的影响。
  • 理解为何在使用此类增强方法时,教师模型泛化能力的提升无法有效传递至学生模型。
  • 量化由混合样本增强技术中的隐式偏差导致的知识蒸馏质量退化。
  • 提出一种新度量方法——类别区分度(Class-Discrimination),用于衡量不同增强策略所诱导的潜在表征的判别能力。
  • 评估教师泛化能力与有效知识迁移至学生模型之间的权衡。

提出的方法

  • 使用四种数据增强策略训练ResNet-18教师模型:标准变换、CutOut、MixUp和CutMix。
  • 应用知识蒸馏训练更小的学生模型,使用教师模型生成的软标签作为监督信号。
  • 提出一种新颖的类别区分度度量方法,用于量化潜在表征的质量及其对蒸馏的影响。
  • 利用混淆矩阵和KL散度分析,比较模型预测的概率分布与人类估计的置信度分布。
  • 通过期望校准误差(ECE)和可靠性图,测量教师和学生模型的校准性能。
  • 通过掩码混淆矩阵分析潜在空间,评估类间判别能力和泛化能力。

实验结果

研究问题

  • RQ1像MixUp和CutMix这样的混合样本数据增强技术如何影响知识蒸馏中学生模型的泛化性能?
  • RQ2经过增强的教师模型在蒸馏到学生网络时,其监督信号在多大程度上发生退化?
  • RQ3通过类别区分度度量所衡量的潜在空间判别能力,在不同增强策略下如何变化?
  • RQ4模型校准与教师模型中数据增强选择之间存在何种关系?
  • RQ5概率分布中类间关系的失真是否可以解释蒸馏后学生模型性能的下降?

主要发现

  • 尽管提升了教师模型性能,但像MixUp和CutMix这样的混合样本增强策略显著损害了学生模型的泛化能力。
  • 类别区分度度量显示,CutMix和MixUp降低了潜在表征的判别能力,限制了有效知识迁移。
  • 混淆矩阵显示,CutMix训练的模型相比基线模型,其非对角线元素更亮、更分散,表明类间泛化能力更差。
  • KL散度分析证实,CutMix模型预测的概率分布相较于基线模型,与人类估计的置信度分布偏离更大。
  • 期望校准误差(ECE)结果表明,插值技术(如MixUp)产生更校准良好的模型,但该结果与学生性能提升无直接关联。
  • 本研究未发现教师模型校准与学生泛化能力之间存在直接关联,表明校准本身并不能确保有效蒸馏。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。