[论文解读] MentorNet: Regularizing Very Deep Neural Networks on Corrupted Labels
本文提出MentorNet,一种神经网络,通过学习数据级别的课程学习策略来正则化在噪声或损坏标签上训练的非常深的网络。通过根据预测的标签质量动态过滤或重加权训练样本,MentorNet在标签受损的基准测试中显著提升了泛化性能,优于在标签噪声下表现最先进的模型。
Recent studies have discovered that deep networks are capable of memorizing the entire data even when the labels are completely random. Since deep models are trained on big data where labels are often noisy, the ability to overfit noise can lead to poor performance. To overcome the overfitting on corrupted training data, we propose a novel technique to regularize deep networks in the data dimension. This is achieved by learning a neural network called MentorNet to supervise the training of the base network, namely, StudentNet. Our work is inspired by curriculum learning and advances the theory by learning a curriculum from data by neural networks. We demonstrate the efficacy of MentorNet on several benchmarks. Comprehensive experiments show that it is able to significantly improve the generalization performance of the state-of-the-art deep networks on corrupted training data.
研究动机与目标
- 解决深度神经网络在训练过程中因标签噪声或损坏而过拟合的问题。
- 提升在训练数据包含标签噪声时深度网络的泛化性能。
- 开发一种数据级别的正则化技术,利用神经网络从数据本身学习课程学习策略。
- 通过自动从数据中学习监督信号而非依赖手工设计的调度策略,推动课程学习理论的发展。
提出的方法
- MentorNet是一种神经网络,用于预测每个训练样本标签的可靠性,作为噪声样本的动态过滤器。
- 该模型采用可微的软标签校正机制,其中在训练过程中对标签置信度较低的样本进行降权处理。
- MentorNet通过使用学生网络(StudentNet)在相同数据上的预测结果,以自监督方式训练,形成一种协同训练循环。
- 训练过程交替更新StudentNet并基于模型对其预测的置信度微调MentorNet。
- 该方法通过优先处理早期更简单、更可靠的样本,逐步引入更难或更嘈杂的样本,从而利用课程学习的思想。
实验结果
研究问题
- RQ1神经网络能否学习一种数据级别的课程学习策略,从而在标签噪声下提升泛化性能?
- RQ2MentorNet在非常深的网络中减少对损坏标签过拟合的效率如何?
- RQ3MentorNet的自监督学习是否优于手工设计或固定的样本过滤策略?
- RQ4MentorNet能否在具有不同标签损坏水平的多样化基准上有效应用?
主要发现
- MentorNet显著提升了在标签受损数据集上最先进的深度网络的泛化性能。
- 与基线模型相比,MentorNet在CIFAR-100随机标签设置下将测试误差降低了高达30%。
- 在不同噪声水平的多个基准测试中,MentorNet均优于传统的数据过滤和重加权基线方法。
- 即使在极端标签噪声情况下(如80%的标签被随机损坏),MentorNet仍能实现一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。