Skip to main content
QUICK REVIEW

[论文解读] Computation-Efficient Knowledge Distillation via Uncertainty-Aware Mixup

Guodong Xu, Ziwei Liu|arXiv (Cornell University)|Dec 17, 2020
Domain Adaptation and Few-Shot Learning参考文献 39被引用 6
一句话总结

本文提出UNIXKD,一种计算效率更高的知识蒸馏方法,通过使用不确定性感知采样优先选择信息量丰富的样本,并结合自适应混合方法压缩知识,在CIFAR100上将训练成本降低21%,同时性能优于传统KD方法,在ImageNet上性能相当但计算成本显著降低。

ABSTRACT

Knowledge distillation, which involves extracting the "dark knowledge" from a teacher network to guide the learning of a student network, has emerged as an essential technique for model compression and transfer learning. Unlike previous works that focus on the accuracy of student network, here we study a little-explored but important question, i.e., knowledge distillation efficiency. Our goal is to achieve a performance comparable to conventional knowledge distillation with a lower computation cost during training. We show that the UNcertainty-aware mIXup (UNIX) can serve as a clean yet effective solution. The uncertainty sampling strategy is used to evaluate the informativeness of each training sample. Adaptive mixup is applied to uncertain samples to compact knowledge. We further show that the redundancy of conventional knowledge distillation lies in the excessive learning of easy samples. By combining uncertainty and mixup, our approach reduces the redundancy and makes better use of each query to the teacher network. We validate our approach on CIFAR100 and ImageNet. Notably, with only 79% computation cost, we outperform conventional knowledge distillation on CIFAR100 and achieve a comparable result on ImageNet.

研究动机与目标

  • 解决知识蒸馏(KD)效率这一研究不足的问题,重点在于降低计算成本而不损害性能。
  • 识别传统KD中因过度学习简单、高置信度样本而产生的冗余问题。
  • 提出一种方法,通过根据不确定性与知识紧凑性动态调整样本重要性,提升训练效率。
  • 证明减少对教师网络的冗余查询可在计算成本更低的前提下维持或提升学生模型性能。

提出的方法

  • 利用学生网络预测的不确定性估计样本的信息量,其中高不确定性表示信息丰富、难以分类的样本。
  • 应用自适应混合:对不确定性高的样本施加轻微混合以保留关键特征,对确定性高的样本施加重度混合以增强知识紧凑性。
  • 使用混合样本经教师网络输出的logits作为软标签,监督学生网络训练,从而减少所需教师前向传播次数。
  • 将效率定义为教师与学生网络的前向/反向传播总次数,实现不同KD方法间的直接比较。
  • 将不确定性采样与混合方法结合,减少在简单样本上的冗余学习,同时增强对困难、边界样本的学习。
  • 使用结合原始样本与混合样本交叉熵损失的学生网络训练方法,其中混合权重根据不确定性水平进行调整。

实验结果

研究问题

  • RQ1知识蒸馏能否在不损害学生性能的前提下实现更高的计算效率?
  • RQ2减少对简单样本的冗余学习是否能提升整体蒸馏效率?
  • RQ3不确定性估计能否有效识别出适合选择性知识迁移的信息样本?
  • RQ4基于不确定性的自适应混合方法如何提升知识紧凑性与模型泛化能力?
  • RQ5在维持或提升学生准确率的前提下,教师前向传播次数最多可降低多少?

主要发现

  • UNIXKD在CIFAR100上将计算成本降低21%(降至基线的79%),同时达到比传统知识蒸馏更高的top-1准确率。
  • 在ImageNet上,UNIXKD以显著更低的计算成本实现了与传统KD相当的性能,展现出强大的泛化能力。
  • 不确定性采样优先选择远离类别中心且教师熵高的样本,证实了这些样本的信息量与难度。
  • 该方法在训练初期几轮内迅速学习到对困难类别样本的采样策略,快速稳定并保持高样本多样性。
  • 采样频率与类别难度之间存在强烈负相关关系:在不确定性下,困难类别被更频繁采样,从而提升其准确率。
  • 随机采样导致各类别采样均匀分布,而不确定性采样通过聚焦于困难样本减少冗余,从而提升效率与准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。