Skip to main content
QUICK REVIEW

[论文解读] Class2Simi: A Noise Reduction Perspective on Learning with Noisy Labels

Songhua Wu, Xiaobo Xia|arXiv (Cornell University)|Jun 14, 2020
Machine Learning and Data Classification被引用 20
一句话总结

本文提出 Class2Simi,一种新颖的噪声减少框架,将噪声类标签转换为噪声相似度标签(指示样本对是否共享同一类别),从而降低有效噪声率。通过在预训练阶段使用噪声点式标签学习深度网络后,再在成对相似度标签上进行训练,该方法在高噪声率及转移矩阵估计误差下均表现出当前最优的抗噪声能力。

ABSTRACT

Learning with noisy labels has attracted a lot of attention in recent years, where the mainstream approaches are in pointwise manners. Meanwhile, pairwise manners have shown great potential in supervised metric learning and unsupervised contrastive learning. Thus, a natural question is raised: does learning in a pairwise manner mitigate label noise? To give an affirmative answer, in this paper, we propose a framework called Class2Simi: it transforms data points with noisy class labels to data pairs with noisy similarity labels, where a similarity label denotes whether a pair shares the class label or not. Through this transformation, the reduction of the noise rate is theoretically guaranteed, and hence it is in principle easier to handle noisy similarity labels. Amazingly, DNNs that predict the clean class labels can be trained from noisy data pairs if they are first pretrained from noisy data points. Class2Simi is computationally efficient because not only this transformation is on-the-fly in mini-batches, but also it just changes loss computation on top of model prediction into a pairwise manner. Its effectiveness is verified by extensive experiments.

研究动机与目标

  • 解决大规模数据集中高标签噪声下训练深度神经网络的挑战。
  • 探究成对学习(利用数据点间关系)是否相较于传统点式方法能内在地缓解标签噪声。
  • 开发一种将噪声类别标签转换为噪声相似度标签的框架,以降低有效噪声率。
  • 建立噪声相似度后验与干净类别后验之间的理论与实践联系,以实现鲁棒模型训练。
  • 证明所提方法对估计类转移矩阵的误差具有鲁棒性,这是许多噪声标签学习方法中的常见挑战。

提出的方法

  • 将每个带有噪声类别标签的训练样本转换为数据对,每对样本被赋予一个噪声相似度标签,用以指示两者是否属于同一类别。
  • 理论上证明,利用转移矩阵形式化(定理2),相似度标签的噪声率低于类别标签,这是由于相似度标签对单个标签错误具有更高的容忍度。
  • 使用标准交叉熵损失在原始噪声点式数据上预训练深度神经网络,以在切换到成对学习前保留语义类别信息。
  • 使用成对损失函数(如 Forward 或 Reweight)微调模型,以纠正噪声相似度标签,并通过内积近似利用干净类别后验。
  • 利用从类别转移矩阵推导出的相似度转移矩阵来建模成对监督中的噪声,确保理论上的鲁棒性。
  • 在小批量训练过程中实时执行转换,最大限度减少计算开销,同时实现高效的成对学习。

实验结果

研究问题

  • RQ1将点式类别标签转换为成对相似度标签,是否能降低训练数据中的有效噪声率?
  • RQ2在深度神经网络中,从噪声相似度标签学习是否比从噪声类别标签学习具有更好的泛化性能?
  • RQ3所提方法对估计类转移矩阵的误差有多鲁棒?这是许多噪声标签学习方法中的关键挑战。
  • RQ4在噪声点式数据上进行预训练,是否能保留足够的语义信息,以支持在噪声成对标签上的有效微调?
  • RQ5在对称与非对称标签噪声设置下,成对学习框架是否优于现有的最先进点式方法?

主要发现

  • 如图1所示,Class2Simi 将有效噪声率从类别标签的 0.5 降低至相似度标签的 0.25,这是由于相似度标签对单个标签错误具有更高的容忍度。
  • 在 CIFAR-10 和 CIFAR-100 上,当噪声率为 60% 时,Class2Simi 相较于基线点式方法分别提升了约 5 和 10 个百分点的准确率。
  • F-Class2Simi 在 Clothing1M* 上达到 75.41% 的准确率,优于 Co-teaching(74.70%)和 S2E(72.30%),表明其在真实世界噪声数据上的强大性能。
  • R-Class2Simi 在 Clothing1M* 上达到 75.76% 的准确率,进一步优于 F-Class2Simi,表明重加权变体的有效性。
  • 该方法对真实转移矩阵的扰动保持鲁棒:尽管 Forward 准确率随噪声急剧下降,F-Class2Simi 仅表现出微小波动,证明了其鲁棒性。
  • 在干净数据集(MNIST、CIFAR10、CIFAR100、News20)上,相似度损失未带来显著准确率提升,确认了在噪声设置下的性能提升源于噪声减少,而非损失设计本身。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。