Skip to main content
QUICK REVIEW

[论文解读] Combining Self-Supervised and Supervised Learning with Noisy Labels

Zhang, Yongqi, Hui Zhang|arXiv (Cornell University)|Nov 16, 2020
Machine Learning and Data Classification参考文献 48被引用 7
一句话总结

该论文提出 CS³NL,一种新颖方法,通过将自监督对比预训练(使用 BYOL)与带有噪声标签的分类器训练解耦,实现表示学习,利用分类器固有的鲁棒性。通过在主干网络与分类器之间停止梯度,并结合 SSRL 与带噪声的监督学习,该方法在高噪声环境下实现了最先进性能,尤其在 CIFAR-10 上将错误率降低了 80%,显著优于现有方法。

ABSTRACT

Since convolutional neural networks (CNNs) can easily overfit noisy labels, which are ubiquitous in visual classification tasks, it has been a great challenge to train CNNs against them robustly. Various methods have been proposed for this challenge. However, none of them pay attention to the difference between representation and classifier learning of CNNs. Thus, inspired by the observation that classifier is more robust to noisy labels while representation is much more fragile, and by the recent advances of self-supervised representation learning (SSRL) technologies, we design a new method, i.e., CS$^3$NL, to obtain representation by SSRL without labels and train the classifier directly with noisy labels. Extensive experiments are performed on both synthetic and real benchmark datasets. Results demonstrate that the proposed method can beat the state-of-the-art ones by a large margin, especially under a high noisy level.

研究动机与目标

  • 为解决在存在标签噪声的数据集上训练深度 CNN 时常见的过拟合与泛化能力差的问题。
  • 探究在标签噪声下表示学习与分类器学习的鲁棒性差异。
  • 通过解耦表示学习与分类器训练,利用简单分类器的内在鲁棒性,提升模型泛化能力。
  • 将最先进的自监督表示学习(BYOL)与带噪声标签的监督学习相结合,以提升性能。
  • 证明将鲁棒表示与抗噪声分类器结合可获得更优结果,尤其在高噪声水平下。

提出的方法

  • 该方法将 CNN 解耦为主干网络(fθ)与分类器(cw),分别进行训练,以利用分类器对噪声标签的鲁棒性。
  • 通过 BYOL 框架进行自监督表示学习,该框架利用数据增强和动量更新的目标网络来学习对比表示。
  • 在主干网络与分类器之间应用停止梯度(sg)操作,仅在监督训练期间更新分类器,从而实现表示学习与分类器学习的解耦。
  • 引入一个标签清洗模块 ψ,用于识别并优先处理干净样本,提升监督损失的可靠性。
  • 总损失结合了自监督的 BYOL 对比损失与清洗后标签上的监督交叉熵损失,实现鲁棒表示与精确分类的联合优化。
  • 框架使用动量更新(τ)从在线网络缓慢更新目标网络参数,以稳定训练。

实验结果

研究问题

  • RQ1在标签噪声下,表示学习的鲁棒性与分类器学习的鲁棒性相比如何?
  • RQ2解耦表示学习与分类器训练是否能在存在标签噪声时提升泛化能力?
  • RQ3将自监督表示学习与带噪声标签的监督学习结合,是否优于端到端训练?
  • RQ4停止梯度与标签清洗组件对模型鲁棒性的影响是什么?
  • RQ5与最先进方法相比,该方法在高噪声水平下的表现如何?

主要发现

  • 在 CIFAR-10 上使用 80% 对称标签噪声时,CS³NL 达到 88.1% 的测试准确率,比标准端到端训练基线高出 25.2 个百分点。
  • 在 40% 噪声下,CS³NL 达到 94.6% 的准确率,在消融实验的各个变体中均比次优方法高出 1.0 至 3.2 个百分点。
  • 消融研究证实,停止梯度操作是最关键的组件,若移除该操作,在 80% 噪声下准确率将下降 7.4 个百分点。
  • 若移除自监督损失(BYOL),在 0% 噪声下准确率下降 2.6 分,表明其在干净数据设置中同样具有价值。
  • 标签清洗模块 ψ 在 80% 噪声下提升性能 1.9 分,表明识别干净样本可增强鲁棒性。
  • 该方法在合成数据集(CIFAR-10)和真实世界噪声基准(CIFAR-100、ImageNet)上均保持强劲性能,展现出广泛的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。