Skip to main content
QUICK REVIEW

[论文解读] CTRL: Clustering Training Losses for Label Error Detection

Chang Yue, Niraj K. Jha|arXiv (Cornell University)|Aug 17, 2022
Machine Learning and Data Classification被引用 4
一句话总结

CTRL 是一种新颖的框架,通过使用 K-means 聚类方法对样本的训练损失轨迹进行聚类,检测多分类数据集中的标签错误。它通过利用干净样本与噪声样本在学习动态上的差异来识别噪声标签,实现了最先进(SOTA)的检测准确率,并在噪声率约为 20% 时使平衡分类准确率提升 10% 以上。

ABSTRACT

In supervised machine learning, use of correct labels is extremely important to ensure high accuracy. Unfortunately, most datasets contain corrupted labels. Machine learning models trained on such datasets do not generalize well. Thus, detecting their label errors can significantly increase their efficacy. We propose a novel framework, called CTRL (Clustering TRaining Losses for label error detection), to detect label errors in multi-class datasets. It detects label errors in two steps based on the observation that models learn clean and noisy labels in different ways. First, we train a neural network using the noisy training dataset and obtain the loss curve for each sample. Then, we apply clustering algorithms to the training losses to group samples into two categories: cleanly-labeled and noisily-labeled. After label error detection, we remove samples with noisy labels and retrain the model. Our experimental results demonstrate state-of-the-art error detection accuracy on both image (CIFAR-10 and CIFAR-100) and tabular datasets under simulated noise. We also use a theoretical analysis to provide insights into why CTRL performs so well.

研究动机与目标

  • 解决监督机器学习数据集中普遍存在的标签污染问题,该问题会损害模型的泛化能力。
  • 在不依赖真实标签信息或噪声模式先验知识的情况下,检测多分类数据集中的噪声标签。
  • 利用不同的学习动态(特别是干净标签的早期记忆化和噪声标签的延迟拟合)来区分干净样本与噪声样本。
  • 通过在微调前移除错误标注的样本实现标签清洗,从而提高模型的鲁棒性和准确率。
  • 为基于损失的聚类在分离干净标签与噪声标签学习轨迹方面的有效性提供理论依据。

提出的方法

  • 在原始噪声数据集上训练神经网络,计算多个训练轮次中每个样本的训练损失曲线。
  • 对所有训练样本的损失轨迹应用 K-means 聚类,将样本分为两个簇:一个对应干净标签,一个对应噪声标签。
  • 利用簇中心将每个样本根据其损失轨迹模式分配为“干净”或“噪声”类别。
  • 将被分类为噪声的样本移除,并在清洗后的数据集上重新训练模型,以提升泛化能力和测试准确率。
  • 该方法依赖于一个观察:模型会更早、以更低损失学习干净标签,从而在过拟合前形成可检测的损失曲线差距。
  • 针对二分类设定提供了理论分析,证明在标准训练动态下,干净标签与噪声标签之间的损失差距具有高度可能性。

实验结果

研究问题

  • RQ1在多分类数据集中,对训练损失轨迹进行聚类是否能有效区分具有干净标签和噪声标签的样本?
  • RQ2在多种数据集上,所提出的 CTRL 框架在标签错误检测准确率方面与现有最先进方法相比表现如何?
  • RQ3在多大程度上,移除检测到的噪声标签能提升下游模型性能,特别是在平衡分类准确率方面?
  • RQ4其有效性在理论上基于什么支持,即基于损失的聚类为何能识别标签错误?
  • RQ5该方法在不同噪声水平、噪声模式(如均匀噪声、类别相关噪声、标签特定噪声)以及数据集类型(图像与表格数据)下的鲁棒性如何?

主要发现

  • 在各种噪声设置下,CTRL 在图像和表格基准数据集上均实现了最先进(SOTA)的标签错误检测准确率。
  • 在噪声率约为 20% 的数据集中,经过 CTRL 清洗后重新训练,平衡分类准确率提升超过 10%。
  • 即使在标签清洗后,该方法的模型测试准确率仍与之前最先进方法相当或更优。
  • 在表格数据集(如 Credit Fraud、Letter Recognition)上的实验表明,该方法在多种噪声模式下均保持一致的高检测准确率(例如,在 10% 噪声下掩码准确率达到 98.7%)。
  • 理论分析证实,在训练初期,干净标签与噪声标签之间存在显著损失差距的概率极高,从而为方法设计提供了理论依据。
  • 消融研究显示,移除噪声样本比其他标签校正或重加权策略更有效,尤其在高噪声率下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。