[论文解读] Blind Knowledge Distillation for Robust Image Classification
该论文提出了一种新型的教师-学生框架——盲知识蒸馏(Blind Knowledge Distillation),通过掩码处理与真实标签相关的logits来检测训练过程中过拟合的起始点,从而实现自适应早停,并利用Otsu算法估计噪声。该方法通过基于估计的标签污染程度校正损失权重,在CIFAR-N等存在噪声的图像数据集上提升了模型鲁棒性,实现了SOTA性能,且无需人工设置预热阶段。
Optimizing neural networks with noisy labels is a challenging task, especially if the label set contains real-world noise. Networks tend to generalize to reasonable patterns in the early training stages and overfit to specific details of noisy samples in the latter ones. We introduce Blind Knowledge Distillation - a novel teacher-student approach for learning with noisy labels by masking the ground truth related teacher output to filter out potentially corrupted knowledge and to estimate the tipping point from generalizing to overfitting. Based on this, we enable the estimation of noise in the training data with Otsus algorithm. With this estimation, we train the network with a modified weighted cross-entropy loss function. We show in our experiments that Blind Knowledge Distillation detects overfitting effectively during training and improves the detection of clean and noisy labels on the recently published CIFAR-N dataset. Code is available at GitHub.
研究动机与目标
- 为解决在存在现实世界标签噪声的图像数据集上训练深度神经网络时导致模型泛化能力下降的挑战。
- 检测在噪声数据上从泛化到过拟合的临界点,从而实现自适应早停。
- 在不依赖预设阈值或预热阶段的前提下,估计每个训练样本被污染或为干净样本的可能性。
- 通过基于噪声估计的损失校正机制,在高噪声水平下提升分类准确率。
- 提供一种即插即用的鲁棒训练方法,可无缝集成到标准分类流水线中。
提出的方法
- 该方法采用学生-教师框架,其中学生网络仅基于教师网络提供的互补logits进行训练,排除与真实标签相关的logits,以防止对标签噪声的过拟合。
- 通过监控学生网络在训练过程中预测结果的平均最大概率,识别过拟合的临界点。
- 在临界点处,对与真实标签相关的概率分布应用Otsu算法,自动分割出干净样本与噪声样本。
- 使用改进的加权交叉熵损失,其中样本权重由估计的标签污染可能性决定。
- 将教师和学生网络的联合概率作为最终预测结果,其性能优于任一模型单独使用。
- 该框架在训练过程中在线运行,动态估计噪声并调整训练过程,无需固定超参数或人工预热阶段。
实验结果
研究问题
- RQ1是否可以在不依赖固定早停策略的前提下,自动检测训练过程中对噪声标签细节的过拟合起始点?
- RQ2Otsu算法在临界点处基于预测置信度对干净样本与噪声样本的分割效果如何?
- RQ3基于估计的标签污染进行损失校正,在CIFAR-N等现实世界噪声数据集上的泛化能力提升程度如何?
- RQ4即使在无法访问真实标签logits的情况下,学生网络是否仍能通过学习可泛化的特征实现高准确率?
- RQ5将教师和学生预测结果结合后,整体鲁棒性相比单独使用任一模型提升了多少?
主要发现
- 盲知识蒸馏成功检测到从泛化到过拟合的临界点,此时标签检测的F1-score达到峰值。
- 该方法在CIFAR-10N上实现了SOTA性能,尤其在高噪声水平下表现优异,且无需人工预热阶段。
- 联合预测概率 $P_A$ 的表现优于教师和学生网络单独使用,尤其在临界点附近表现更优。
- 由于训练期间排除了真实标签logits,学生网络在教师开始过拟合后仍能保持高准确率。
- 该框架显著提升了CIFAR-N数据集中‘Worst’噪声设置下的分类准确率,证明了其对现实世界标签噪声的鲁棒性。
- Otsu算法能有效基于临界点处 $P(y=\overline{y}|x)$ 的分布分离出干净与噪声标签,实现精确的噪声估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。