Skip to main content
QUICK REVIEW

[论文解读] How does Early Stopping Help Generalization against Label Noise?

Hwanjun Song, Minseok Kim|arXiv (Cornell University)|Nov 19, 2019
Machine Learning and Data Classification参考文献 26被引用 19
一句话总结

本文提出Prestopping,一种两阶段训练方法,通过早停防止深度神经网络对噪声标签过拟合,随后在高置信度样本的'最大安全集'上进行微调。该方法显著提升了泛化性能,在四种基准数据集上,面对不同类型的标签噪声,测试误差降低了0.4–8.2个百分点,优于当前最先进方法。

ABSTRACT

Noisy labels are very common in real-world training data, which lead to poor generalization on test data because of overfitting to the noisy labels. In this paper, we claim that such overfitting can be avoided by "early stopping" training a deep neural network before the noisy labels are severely memorized. Then, we resume training the early stopped network using a "maximal safe set," which maintains a collection of almost certainly true-labeled samples at each epoch since the early stop point. Putting them all together, our novel two-phase training method, called Prestopping, realizes noise-free training under any type of label noise for practical use. Extensive experiments using four image benchmark data sets verify that our method significantly outperforms four state-of-the-art methods in test error by 0.4-8.2 percent points under existence of real-world noise.

研究动机与目标

  • 解决在存在标签噪声的数据上训练深度神经网络时泛化性能差的问题。
  • 克服基于损失的样本选择方法的局限性,这些方法在真实世界噪声和成对噪声下因损失分布重叠而失效。
  • 开发一种鲁棒、与噪声无关的训练方法,可在多种噪声类型下有效工作。
  • 识别并消除训练过程中错误标签被记忆的'易错阶段',从而提升模型泛化能力。

提出的方法

  • 该方法基于对后期训练中错误标签记忆化现象上升的实证观察,在网络开始记忆错误标签前实施早停。
  • 从早停点损失较低的样本中构建'最大安全集',假设这些样本更可能被正确标注。
  • 早停后,网络仅在最大安全集上重新训练,以实现无噪声的优化。
  • 该方法引入历史长度超参数q,基于近期训练动态稳定安全样本的选择。
  • 在CIFAR-10、CIFAR-100、ANIMAL-10N和FOOD-101N上评估了该方法,涵盖对称噪声、成对噪声和真实世界噪声等多种噪声类型。
  • 为确保公平比较,所有实验中学习率衰减和批量归一化等超参数设置保持一致。

实验结果

研究问题

  • RQ1早停是否能通过在模型记忆错误标签前停止训练,从而防止对噪声标签的过拟合?
  • RQ2在早停后,仅在低损失样本构成的最大安全集上微调,是否能比标准训练获得更好的泛化性能?
  • RQ3在包括真实世界噪声在内的多种标签噪声类型下,Prestopping相较于最先进方法表现如何?
  • RQ4为何基于损失的样本选择方法在成对噪声和真实世界噪声下会失效?早停能否缓解此问题?
  • RQ5该方法是否也能修正基准数据集中原始标注错误,即使在0%噪声下也能提升性能?

主要发现

  • 在四种基准数据集上,面对不同噪声类型,Prestopping相比最先进方法将测试误差降低了0.4–8.2个百分点。
  • 该方法优于Co-teaching+及其他基于损失的方法,尤其在真实世界噪声和成对噪声下表现更优,后者因损失分布重叠而失效。
  • 网格搜索确定历史长度q=10为安全集构建的最优值,在所有数据集和噪声类型下均使测试误差最小化。
  • Prestopping+成功修复了CIFAR-100中的原始标注错误,即使在0%噪声下也纠正了如'Boy'误标为'Baby'、'Mouse'误标为'Hamster'等错误。
  • 该方法有效消除了错误标签记忆化加速的'易错阶段',从而提升了收敛性和泛化能力。
  • 在真实世界噪声下性能提升最为显著(例如在FOOD-101N上降低8.2个百分点),而现有方法在此类噪声下表现最差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。