[论文解读] Learning Not to Learn in the Presence of Noisy Labels
本文提出了一种名为赌徒损失(gambler’s loss)的新损失函数,可使神经网络在面对噪声标签时选择不学习,从而提升模型的鲁棒性与泛化能力。该方法还提出了一个基于理论分析的早停准则,以及一种不依赖噪声率的超参数调度启发式方法,在 MNIST、CIFAR-10 和 IMDB 数据集上,于不同标签噪声率下均实现了最先进性能。
Learning in the presence of label noise is a challenging yet important task: it is crucial to design models that are robust in the presence of mislabeled datasets. In this paper, we discover that a new class of loss functions called the gambler's loss provides strong robustness to label noise across various levels of corruption. We show that training with this loss function encourages the model to "abstain" from learning on the data points with noisy labels, resulting in a simple and effective method to improve robustness and generalization. In addition, we propose two practical extensions of the method: 1) an analytical early stopping criterion to approximately stop training before the memorization of noisy labels, as well as 2) a heuristic for setting hyperparameters which do not require knowledge of the noise corruption rate. We demonstrate the effectiveness of our method by achieving strong results across three image and text classification tasks as compared to existing baselines.
研究动机与目标
- 解决在存在误标样本的数据集中训练深度神经网络所面临的挑战,此类样本会降低模型的泛化能力。
- 开发一种训练方法,通过鼓励模型在不确定或受损样本上选择不学习,避免对噪声标签的过记忆。
- 设计一种实用的早停准则,无需依赖验证集,且适用于不同模型与任务。
- 设计一种超参数调度启发式方法,无需事先知晓标签噪声率。
- 在高比例标签噪声条件下,于图像与文本分类基准上实现最先进性能。
提出的方法
- 赌徒损失函数基于赌博类比推导,模型在不确定时可‘放弃’预测,从而减少对噪声标签的依赖。
- 该损失函数通过引入阈值机制,对低置信度预测抑制梯度,从而在标准交叉熵基础上进行修改。
- 从赌徒损失的理论动态中推导出一种分析性早停(AES)准则,可在模型开始记忆噪声标签前终止训练。
- 提出一种动态超参数调度方法,可自动调整损失缩放系数,而无需了解噪声率。
- 该方法应用于基于标准架构与优化器的图像(MNIST、CIFAR-10)与文本(IMDB)分类任务。
- 在不同噪声率下,将该方法与最先进基线(包括 Co-teaching+ 和广义交叉熵(Lq))进行对比评估。
实验结果
研究问题
- RQ1能否通过一种鼓励在不确定样本上选择不学习的修改后损失函数,提升深度学习模型对标签噪声的鲁棒性?
- RQ2赌徒损失函数是否能引导出延迟或防止对噪声标签过记忆的训练轨迹?
- RQ3能否从损失函数动态中推导出一种分析性早停准则,以避免使用验证集而实现过拟合控制?
- RQ4能否设计一种超参数调度启发式方法,使其在不预先知晓噪声污染率的情况下仍表现良好?
- RQ5所提出方法是否能在高标签噪声条件下,于多样化的图像与文本分类任务中实现最先进性能?
主要发现
- 在 MNIST 数据集上,当标签噪声率达 80% 时,采用自动调度的赌徒损失在绝对准确率上比 Co-teaching+ 高出 30 个百分点。
- 在 CIFAR-10 数据集上,当噪声率达 80% 时,该方法相较 Co-teaching+ 提升了 15 个百分点。
- 分析性早停(AES)方法相比基于验证集的早停,将训练时间减少最多达 10 倍,同时在 MNIST 上将测试准确率提升最多达 70%。
- 所提出的超参数调度启发式方法在 12 项评估设置中的 11 项上优于广义交叉熵(Lq),尤其在高噪声率下表现更优。
- 该方法在所有三个基准测试(MNIST、CIFAR-10 和 IMDB)中均实现了最先进结果,且无需知晓真实噪声率。
- 赌徒损失展现出强大的泛化能力,性能增益随噪声率升高而增加,表明其对极端标签污染具有强鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。