Skip to main content
QUICK REVIEW

[论文解读] Robustness of Accuracy Metric and its Inspirations in Learning with Noisy Labels

Pengfei Chen, Junjie Ye|arXiv (Cornell University)|Dec 8, 2020
Machine Learning and Data Classification参考文献 51被引用 10
一句话总结

本文证明了在类别条件标签噪声下,准确率度量具有鲁棒性,即在噪声训练数据上最大化准确率可得到在干净数据上近乎最优的分类器。此外,本文从理论上支持了使用噪声验证集进行模型选择,此前这一做法缺乏理论依据,从而实现了可靠的超参数调优与早停策略。该方法通过一种新框架——噪声最佳教师与学生(NTS)得到验证,该框架在CIFAR-10/100和Clothing1M数据集上实现了最先进性能,且噪声为真实世界中的噪声。

ABSTRACT

For multi-class classification under class-conditional label noise, we prove that the accuracy metric itself can be robust. We concretize this finding's inspiration in two essential aspects: training and validation, with which we address critical issues in learning with noisy labels. For training, we show that maximizing training accuracy on sufficiently many noisy samples yields an approximately optimal classifier. For validation, we prove that a noisy validation set is reliable, addressing the critical demand of model selection in scenarios like hyperparameter-tuning and early stopping. Previously, model selection using noisy validation samples has not been theoretically justified. We verify our theoretical results and additional claims with extensive experiments. We show characterizations of models trained with noisy labels, motivated by our theoretical results, and verify the utility of a noisy validation set by showing the impressive performance of a framework termed noisy best teacher and student (NTS). Our code is released.

研究动机与目标

  • 从理论上证明在超参数调优和早停中使用噪声验证集的合理性,此前该方法缺乏正式理论支持。
  • 证明在足够多的噪声样本上最大化训练准确率,即使不使用鲁棒损失函数,也能得到近似最优的分类器。
  • 刻画在噪声监督下的模型行为,表明随着数据量增加,模型性能趋近最优。
  • 通过一种新框架——噪声最佳教师与学生(NTS),验证噪声验证在实践中的有效性,该框架在合成与真实世界噪声基准上均表现优异。

提出的方法

  • 证明对于对角占优的类别条件噪声,最大化噪声分布上的准确率可确保在干净分布上也最大化准确率。
  • 基于VC维提出一个泛化界,表明在大规模噪声数据集上训练的准确率可近似最优分类器。
  • 证明在保留的噪声验证集上的准确率是真实噪声分布准确率的无偏估计量,从而为模型选择提供理论依据。
  • 提出一种名为噪声最佳教师与学生(NTS)的框架,其中教师模型基于其在噪声验证集上的最高准确率进行选择,学生模型则从该教师模型重新训练。
  • 采用标准的数据增强和训练协议,通过噪声验证集对超参数进行调优,以确保公平比较。
  • 通过可视化模型行为及在CIFAR-10/100和Clothing1M上的大量实验,验证理论结论,涵盖合成噪声与真实世界噪声。

实验结果

研究问题

  • RQ1准确率度量本身是否对类别条件标签噪声具有鲁棒性,即在噪声数据上最大化准确率是否能导致在干净数据上的最优性能?
  • RQ2在足够多的噪声样本上训练,即使不使用专门的鲁棒损失函数,是否仍能获得近似最优的分类器?
  • RQ3尽管存在标签噪声,噪声验证集是否仍可作为可靠的模型选择工具,例如用于超参数调优与早停?
  • RQ4像噪声最佳教师与学生(NTS)这样的框架,是否能利用噪声验证集在噪声标签学习中实现最先进性能?

主要发现

  • 理论分析表明,对于对角占优的类别条件噪声,最大化噪声分布上的准确率可保证最大化干净分布上的准确率。
  • 在足够多的噪声样本上训练的模型会收敛到全局最优分类器,其行为从少量样本时的“随机分类器”(dummy classifier)逐步过渡到预测噪声转移矩阵的阶段。
  • 噪声验证集是真实噪声分布准确率的可靠估计量,因此在缺乏干净验证数据的情况下,其在模型选择中的使用具有理论依据。
  • NTS框架通过基于噪声验证集表现选择教师模型,在CIFAR-10/100的合成噪声设置下,以及在Clothing1M的真实世界噪声设置下,均持续优于多个基线模型。
  • 消融实验表明,NTS在不同数据增强策略下(包括无增强、标准增强与强增强)均保持性能优势,证明其鲁棒性与实用性。
  • 在Clothing1M数据集上,NTS实现了与基于干净验证的基线模型相当的性能,表明在真实世界场景中,噪声验证已足够且有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。