Skip to main content
QUICK REVIEW

[论文解读] Teacher's pet: understanding and mitigating biases in distillation

Michał Łukasik, Srinadh Bhojanapalli|arXiv (Cornell University)|Jun 19, 2021
Machine Learning and Data Classification参考文献 43被引用 5
一句话总结

本文指出,知识蒸馏可能导致在低频数据子群上的性能下降,特别是对罕见类别而言,这是由于教师模型传播并放大了自身的错误。为缓解此问题,作者提出了AdaAlpha和AdaMargin,通过为每个类别自适应地调整混合权重和边缘,减少教师模型在不可靠子群上的影响,从而在不牺牲整体性能的前提下提升子群准确率。

ABSTRACT

Knowledge distillation is widely used as a means of improving the performance of a relatively simple student model using the predictions from a complex teacher model. Several works have shown that distillation significantly boosts the student's overall performance; however, are these gains uniform across all data subgroups? In this paper, we show that distillation can harm performance on certain subgroups, e.g., classes with few associated samples. We trace this behaviour to errors made by the teacher distribution being transferred to and amplified by the student model. To mitigate this problem, we present techniques which soften the teacher influence for subgroups where it is less reliable. Experiments on several image classification benchmarks show that these modifications of distillation maintain boost in overall accuracy, while additionally ensuring improvement in subgroup performance.

研究动机与目标

  • 探究知识蒸馏是否在所有数据子群中均匀提升性能,尤其是对低频类别的影响。
  • 识别在蒸馏过程中罕见或低频类别性能下降的根本原因。
  • 通过自适应降低教师模型在不可靠子群上的影响,开发缓解蒸馏引入偏差的方法。
  • 确保蒸馏能提升所有类别(而不仅仅是整体平均)的准确率,同时不损害模型整体性能。

提出的方法

  • 提出AdaAlpha方法,通过在独热标签与教师模型输出概率之间为每个类别自适应调整混合权重,降低教师模型在错误预测中过度自信类别上的影响。
  • 引入AdaMargin方法,为每个类别应用自适应边缘,以软化蒸馏信号,尤其针对教师模型对错误预测具有高置信度的类别。
  • 利用真实标签中的类别特定置信度分数,判断哪些子群需要减少教师模型的影响,依据是教师模型的可靠性。
  • 采用基于温度的软化机制,动态调整每个类别的蒸馏损失,提升尾部类别上的泛化能力。
  • 在长尾基准数据集(如CIFAR-100-LT和ImageNet)上评估方法,比较子群与整体准确率。
  • 进行消融实验,验证精确的类别级加权的必要性,结果表明随机打乱或全局移除蒸馏信号的策略性能更差。

实验结果

研究问题

  • RQ1知识蒸馏是否在所有数据子群中均匀提升性能,还是对低频类别的提升效果更差?
  • RQ2当教师模型对错误预测具有高度置信度时,为何在蒸馏过程中罕见类别的性能会下降?
  • RQ3对子群自适应加权蒸馏信号能否缓解偏差并提升各类别之间的公平性?
  • RQ4所提出的AdaAlpha和AdaMargin方法是否在提升子群性能的同时,仍能保持整体准确率?

主要发现

  • 在CIFAR-100-LT上,尽管整体准确率提升了约1%,但蒸馏使最差10个类别的准确率下降了约2个百分点。
  • 在ImageNet上,蒸馏使最差10个类别的平均准确率下降约3个百分点,表明子群性能显著退化。
  • 与标准蒸馏相比,AdaAlpha在CIFAR-100-LT上将最差类别准确率提升了超过3个百分点,同时保持或略微提升平均准确率。
  • 在CIFAR-100-LT上,AdaAlpha实现了75.52%的平均准确率,优于原始蒸馏方法及其他基线模型(包括Zhou et al., 2021)。
  • AdaMargin使边缘和对数损失分布更加平滑,在其他方法失败的某个类别桶中实现了正边缘,提升了尾部类别的置信度。
  • 消融实验表明,精确的类别级加权至关重要——随机打乱或从低频类别中移除蒸馏信号的策略性能均低于所提方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。