Skip to main content
QUICK REVIEW

[论文解读] Mitigating Memorization of Noisy Labels via Regularization between Representations

Hao Cheng, Zhaowei Zhu|arXiv (Cornell University)|Oct 18, 2021
Machine Learning and Data Classification被引用 8
一句话总结

该论文提出了一种表示正则化器,通过强制自监督特征距离与监督模型输出距离之间保持正相关,减轻深度神经网络对噪声标签的记忆。通过将网络解耦为编码器和线性分类器,该方法在不改变网络架构的前提下限制函数空间,显著提升了在噪声数据集上的鲁棒性,尤其在高噪声率下表现优异,并且与现有的鲁棒损失函数兼容。

ABSTRACT

Designing robust loss functions is popular in learning with noisy labels while existing designs did not explicitly consider the overfitting property of deep neural networks (DNNs). As a result, applying these losses may still suffer from overfitting/memorizing noisy labels as training proceeds. In this paper, we first theoretically analyze the memorization effect and show that a lower-capacity model may perform better on noisy datasets. However, it is non-trivial to design a neural network with the best capacity given an arbitrary task. To circumvent this dilemma, instead of changing the model architecture, we decouple DNNs into an encoder followed by a linear classifier and propose to restrict the function space of a DNN by a representation regularizer. Particularly, we require the distance between two self-supervised features to be positively related to the distance between the corresponding two supervised model outputs. Our proposed framework is easily extendable and can incorporate many other robust loss functions to further improve performance. Extensive experiments and theoretical analyses support our claims. Code is available at github.com/UCSC-REAL/SelfSup_NoisyLabel.

研究动机与目标

  • 为解决深度神经网络在训练过程中尤其在高噪声率下对噪声标签产生记忆的长期问题。
  • 通过将泛化误差分解为估计误差和近似误差,对记忆效应进行理论分析。
  • 提出一种与模型无关的正则化框架,在不修改网络架构的前提下限制DNN的函数空间。
  • 证明表示正则化可与现有鲁棒损失函数结合,进一步提升性能。
  • 表明低容量模型在噪声数据集上可能具有更好的泛化能力,从而激励采用结构化正则化方法。

提出的方法

  • 将DNN分解为固定编码器和可训练线性分类器,以实现表示学习与分类的解耦。
  • 引入一种表示正则化器,强制自监督特征的L2距离与监督模型输出的L2距离之间保持正相关。
  • 使用平滑L1损失衡量预测距离与目标距离之间的差异,提升训练稳定性。
  • 在微调噪声标签之前,使用对比自监督学习(如SimCLR或MoCo)预训练编码器。
  • 将正则化器与标准交叉熵损失结合,实现与现有鲁棒损失函数的兼容性。
  • 应用早停和下采样策略,进一步减小高噪声场景下的泛化差距。

实验结果

研究问题

  • RQ1将泛化误差分解为估计误差和近似误差,如何指导在标签噪声下的模型容量选择?
  • RQ2一种强制自监督与监督特征之间结构一致性的表示正则化器,能否减少对噪声标签的记忆?
  • RQ3与标准鲁棒损失相比,强制特征距离与输出距离之间保持正相关,是否能提升在噪声数据集上的鲁棒性?
  • RQ4该正则化器在多大程度上可与现有鲁棒损失函数结合以进一步提升性能?
  • RQ5该正则化器的有效性是否依赖于自监督预训练方法的选择?

主要发现

  • 所提出的正则化器显著减少了对噪声标签的记忆,尤其在高噪声率下(例如0.8),在CIFAR10N和CIFAR100N上提升了测试准确率。
  • 在CIFAR10数据集上,对称标签噪声率为0.8时,使用MoCo预训练的方法达到88.51%的准确率,优于使用固定编码器的标准交叉熵损失。
  • 消融实验表明,性能提升主要源于正则化器本身,而非仅依赖于自监督预训练。
  • 该方法在不同SSL预训练方法(SimCLR和MoCo)下均表现稳健,性能非常相似,表明其具备良好的泛化能力。
  • 使用平滑L1损失作为正则化损失相比标准MSE,能提升训练稳定性和泛化性能。
  • 通过下采样平衡类别分布,即使在未知真实噪声率的情况下,也能进一步减小泛化差距,支持理论假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。