Skip to main content
QUICK REVIEW

[论文解读] Curriculum Loss: Robust Learning and Generalization against Label Corruption

Yueming Lyu, Ivor W. Tsang|arXiv (Cornell University)|May 24, 2019
Machine Learning and Data Classification参考文献 29被引用 83
一句话总结

提出 Curriculum Loss (CL) 作为对 0-1 loss 的紧密上界,能够自适应地选择训练样本,从而提高对标签噪声的鲁棒性。扩展到 Noise Pruned Curriculum Loss (NPCL),以应对更高的噪声率,并支持小批量训练。

ABSTRACT

Deep neural networks (DNNs) have great expressive power, which can even memorize samples with wrong labels. It is vitally important to reiterate robustness and generalization in DNNs against label corruption. To this end, this paper studies the 0-1 loss, which has a monotonic relationship with an empirical adversary (reweighted) risk~\citep{hu2016does}. Although the 0-1 loss has some robust properties, it is difficult to optimize. To efficiently optimize the 0-1 loss while keeping its robust properties, we propose a very simple and efficient loss, i.e. curriculum loss (CL). Our CL is a tighter upper bound of the 0-1 loss compared with conventional summation based surrogate losses. Moreover, CL can adaptively select samples for model training. As a result, our loss can be deemed as a novel perspective of curriculum sample selection strategy, which bridges a connection between curriculum learning and robust learning. Experimental results on benchmark datasets validate the robustness of the proposed loss.

研究动机与目标

  • 在标签污染和嘈杂标签下,驱动深度网络的鲁棒性与泛化能力。
  • 引入一个更紧凑高效的 0-1 loss 上界,保持良好可优化性。
  • 发展一种基于自适应课程的训练样本选择机制。
  • 将 CL 扩展为带有噪声剪枝的版本,以应对高噪声率。
  • 为深度模型提供可实践的、可插拔的带 mini-batch 更新的损失函数。

提出的方法

  • 将 Curriculum Loss (CL) 定义为对 0-1 loss 的更紧密上界,使用基损失 l(u) 满足 l(u) ≥ 1(u<0)。
  • 给出 CL 上界 J(u) ≤ Q(u) ≤ ŴJ(u),并通过对二元选择器 v 的部分优化实现自适应样本选择。
  • 给出一个 O(n log n) 算法(Algorithm 1),用于在支持 mini-batch 的情况下计算 CL 的最优样本子集。
  • 通过引入对噪声率 ε 的先验以及在训练中移除可能嘈杂样本的剪枝机制(Eq. 18),引入 Noise Pruned Curriculum Loss (NPCL)。
  • 给出用于高效 mini-batch 训练的基于批次的版本(шL)(Eq. 20–21)。
  • 描述将样本选择整合到标准深度学习工作流中的训练流程(Algorithm 2)。

实验结果

研究问题

  • RQ1更紧密的 0-1 loss 上界是否能在不牺牲优化效率的前提下提升对标签污染的鲁棒性?
  • RQ2基于自适应课程的样本选择是否能在嘈杂标签下提升泛化能力,超过现有的鲁棒损失?
  • RQ3在不同噪声率和数据集上,NPCL 相对于基线鲁棒损失的表现如何?
  • RQ4提出的损失函数是否可以在常用深度学习框架中以插件形式实现,支持 mini-batch 更新?
  • RQ5CL/NPCL 中嵌入的样本选择算法有哪些计算性质(复杂度、收敛性)?

主要发现

  • CL 相对于传统替代损失,提供了对 0-1 loss 的更紧密上界,从而实现鲁棒学习。
  • 简单的 O(n log n) 算法(Algorithm 1)可在 mini-batch 支持下自适应地选择用于课程训练的样本。
  • NPCL 通过在先验 ε 和课程框架下剪枝可能存在噪声的样本,在更高噪声率下提升鲁棒性。
  • 实验结果表明,在若干设置中,NPCL 常常优于广义交叉熵(GCE),并在更强噪声下与 Co-teaching 方法相匹配或超过之。
  • 该方法可作为深度模型的插件损失,并在批量更新下保持计算效率。
  • 在 MNIST、CIFAR-10/100 和 Tiny-ImageNet 上的多项实验表明,在对称和成对标签污染情景下具有鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。