Skip to main content
QUICK REVIEW

[论文解读] Towards Understanding Deep Learning from Noisy Labels with Small-Loss Criterion

Xian-Jin Gui, Wei Wang|arXiv (Cornell University)|Jun 17, 2021
Machine Learning and Data Classification参考文献 33被引用 12
一句话总结

本文对深度学习中带噪声标签的少量损失准则进行了理论分析,解释了其在对角优势标签噪声下的有效性原因。提出了一种经过重构的加权小损失准则,采用自适应重加权机制,在各种噪声设置下的合成数据集和真实世界数据集上均表现出更强的鲁棒性和更高的准确率。

ABSTRACT

Deep neural networks need large amounts of labeled data to achieve good performance. In real-world applications, labels are usually collected from non-experts such as crowdsourcing to save cost and thus are noisy. In the past few years, deep learning methods for dealing with noisy labels have been developed, many of which are based on the small-loss criterion. However, there are few theoretical analyses to explain why these methods could learn well from noisy labels. In this paper, we theoretically explain why the widely-used small-loss criterion works. Based on the explanation, we reformalize the vanilla small-loss criterion to better tackle noisy labels. The experimental results verify our theoretical explanation and also demonstrate the effectiveness of the reformalization.

研究动机与目标

  • 为了从理论上解释小损失准则为何在深度学习中能有效处理带噪声标签。
  • 为了识别小损失准则起效的必要理论条件——对角优势噪声。
  • 通过基于损失大小的自适应重加权,对原始小损失准则进行重构。
  • 通过实证验证理论洞见,并在带噪声基准数据集上展示性能提升。

提出的方法

  • 理论分析推导出小损失准则具有良好泛化能力的条件,表明对角优势噪声是其有效性的关键。
  • 提出一种加权小损失准则,其中样本权重随平均损失增加而呈指数下降,使用超参数 κ 控制敏感度。
  • 引入重加权函数:w(x,ỹ) = exp(−κ·(ℓ̄(x,ỹ)−ℓ*(i))/(ℓ*(i)−ℓ*(i))),其中 ℓ*(i) 表示类别 i 的最小损失。
  • 在半监督框架(Weighted_MixMatch)中应用加权选择,结合数据增强、标签猜测和锐化处理。
  • 采用加权重采样策略,降低训练集中高损失样本的权重,从而减轻噪声影响。
  • 以标准 MixMatch 作为基线方法,通过引入基于损失的重加权和 κ 的超参数调优进行扩展。

实验结果

研究问题

  • RQ1小损失准则在何种理论条件下能成功从带噪声标签中学习?
  • RQ2尽管存在标签噪声,为何小损失准则在实践中依然有效?
  • RQ3如何改进原始小损失准则以更好地处理带噪声标签?
  • RQ4基于损失值选择样本的最优重加权策略是什么?
  • RQ5超参数 κ 的选择如何影响不同噪声类型和噪声率下的性能表现?

主要发现

  • 当标签噪声为对角优势时,小损失准则能有效发挥作用,这与先前研究的常见假设一致。
  • 所提出的加权小损失准则在 κ > 0 时,无论在何种噪声类型和噪声率下,均在 CIFAR-10 和 CIFAR-100 上持续优于原始版本。
  • 在 CIFAR-10 上,当噪声率为 50% 的均匀噪声时,κ = −log(0.7) 的最佳准确率达到 93.38%,显著优于 κ = 0.0 时的 93.21%。
  • 在 CIFAR-10 上,当成对噪声率 r=0.4 时,该方法在 κ = −log(0.7) 时达到 89.77% 的准确率,优于 κ = 0.0 时的 88.87%。
  • 在 CIFAR-100 上,当噪声率为 40% 的均匀噪声时,该方法在 κ = −log(0.7) 时达到 71.51% 的准确率,优于 κ = 0.0 时的 71.33%。
  • 结果表明,当标签选择精度较低时(如成对噪声或结构化噪声场景),较大的 κ 值更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。