[论文解读] Circumventing Outliers of AutoAugment with Knowledge Distillation
该论文提出将知识蒸馏与AutoAugment结合,以缓解由激进数据增强引起的训练不稳定性问题,此类增强可能移除判别性特征并导致标签模糊。通过使用教师模型提供软化标签,该方法稳定了训练过程,并在不使用额外数据的情况下,实现了ImageNet上85.8%的新SOTA top-1准确率。
AutoAugment has been a powerful algorithm that improves the accuracy of many vision tasks, yet it is sensitive to the operator space as well as hyper-parameters, and an improper setting may degenerate network optimization. This paper delves deep into the working mechanism, and reveals that AutoAugment may remove part of discriminative information from the training image and so insisting on the ground-truth label is no longer the best option. To relieve the inaccuracy of supervision, we make use of knowledge distillation that refers to the output of a teacher model to guide network training. Experiments are performed in standard image classification benchmarks, and demonstrate the effectiveness of our approach in suppressing noise of data augmentation and stabilizing training. Upon the cooperation of knowledge distillation and AutoAugment, we claim the new state-of-the-art on ImageNet classification with a top-1 accuracy of 85.8%.
研究动机与目标
- 为解决在使用激进数据增强时,AutoAugment因移除语义信息并导致标签模糊而引发的训练不稳定性与性能下降问题。
- 探究当增强引起的噪声使真实标签不可靠时,知识蒸馏是否可作为鲁棒的监督信号。
- 在极端数据增强策略下,提升视觉模型的泛化能力与鲁棒性,尤其针对高容量网络。
- 仅使用标准训练数据,在不依赖额外弱标签或无标签数据的情况下,实现ImageNet上的SOTA性能。
提出的方法
- 该方法使用预训练的教师模型为增强图像生成软化后的概率分布,与真实标签一同用于指导学生网络的训练。
- 通过KL散度计算知识蒸馏损失,比较教师模型与学生模型的top-K类别概率,其中K随增强强度的增加而增大。
- 蒸馏损失通过超参数λ加权,该参数在增强强度较高时增大,以增强教师模型的指导作用。
- 学生模型采用联合损失函数进行训练:包括真实标签的交叉熵损失,以及教师提供软标签的KL散度损失。
- 该方法被应用于AutoAugment与RandAugment的搜索空间,且在不同模型规模下均取得一致性能提升。
- 对于大型模型(如EfficientNet-B8),采用性能最佳的EfficientNet-B7作为教师模型,以克服GPU显存限制。
实验结果
研究问题
- RQ1当AutoAugment通过激进增强引入噪声并移除判别性特征时,知识蒸馏是否能有效稳定训练?
- RQ2使用教师模型提供的软化标签,是否能降低由高阶数据增强引起的标签模糊带来的负面影响?
- RQ3在高容量模型(如EfficientNet-B7与B8)中,使用知识蒸馏后,基于AutoAugment的训练性能如何变化?
- RQ4所提出的方法是否能在不依赖额外训练数据(如弱标签或无标签图像)的情况下,实现ImageNet上的SOTA准确率?
- RQ5增强强度与应考虑用于蒸馏的top-k类别数量之间是否存在相关性,以维持稳健的监督?
主要发现
- 所提方法在使用EfficientNet-B8时,实现了85.8%的ImageNet新SOTA top-1准确率,较之前最佳结果提升0.3%,且未使用任何额外训练数据。
- 在EfficientNet-B7上,top-1准确率从84.9%提升至85.5%,显著提高0.6%,优于不使用对抗样本的AdvProp方法。
- 该方法在强增强设置下显著稳定了训练过程,而基线RandAugment在高畸变强度下常导致优化不稳定。
- 在CIFAR-100上,使用强基线模型(PyramidNet + ShakeDrop)时,该方法实现了10.6%的测试误差,优于所有具有相似训练成本的可比方法。
- 教师模型的引入显著抑制了数据增强带来的噪声,尤其在亮度变化、平移或剪切等变换导致语义信息丢失时效果明显。
- 该方法在多种模型规模与增强策略下均表现出一致的性能提升,验证了其泛化能力与鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。