Skip to main content
QUICK REVIEW

[论文解读] Constrained Instance and Class Reweighting for Robust Learning under Label Noise

Abhishek Kumar, Ehsan Amid|arXiv (Cornell University)|Nov 9, 2021
Machine Learning and Data Classification被引用 6
一句话总结

本文提出了一种基于优化的、原则性的方法,通过使用约束分歧最小化动态重加权训练样本和类别,实现标签噪声下的鲁棒学习。该方法通过每小批量求解闭式更新,在内存开销极小的情况下实现最先进性能,尤其在高噪声环境下优于现有方法,并可与Mixup无缝集成。

ABSTRACT

Deep neural networks have shown impressive performance in supervised learning, enabled by their ability to fit well to the provided training data. However, their performance is largely dependent on the quality of the training data and often degrades in the presence of noise. We propose a principled approach for tackling label noise with the aim of assigning importance weights to individual instances and class labels. Our method works by formulating a class of constrained optimization problems that yield simple closed form updates for these importance weights. The proposed optimization problems are solved per mini-batch which obviates the need of storing and updating the weights over the full dataset. Our optimization framework also provides a theoretical perspective on existing label smoothing heuristics for addressing label noise (such as label bootstrapping). We evaluate our method on several benchmark datasets and observe considerable performance gains in the presence of label noise.

研究动机与目标

  • 通过动态分配训练实例和类别的重要性权重,解决深度神经网络在标签噪声下的性能退化问题。
  • 开发一种可扩展的训练方法,避免存储全局重要性权重,从而适用于大规模和流式训练场景。
  • 通过统一的优化框架,为现有标签平滑启发式方法(如标签自举)提供理论基础。
  • 在各种标签噪声设置(包括对称和非对称噪声)下,提升在干净测试数据上的泛化能力。
  • 实现与数据增强技术(如Mixup)的无缝集成,以进一步提升性能。

提出的方法

  • 构建一个约束优化问题,通过最小化实例权重与参考分布(如均匀分布)之间的分歧约束下的期望损失,使用α-分歧等分歧度量。
  • 在每小批量上求解优化问题,得到实例和类别权重的闭式更新,无需在全数据集上存储权重。
  • 提出两种变体:约束实例重加权(CIW)用于单个样本,以及约束实例与类别重加权(CICW)用于联合实例和类别级别的加权。
  • 推导出标签自举及其他启发式方法作为该框架在特定分歧选择下的特例,提供理论依据。
  • 通过在Mixup样本上应用动态重加权,提出一种新颖的与Mixup的集成方式,显著提升鲁棒性。
  • 采用小批量优化策略,确保低内存和计算开销,适用于大规模和流式训练。

实验结果

研究问题

  • RQ1基于优化的实例和类别重加权原则性框架是否能提升深度学习在标签噪声下的鲁棒性?
  • RQ2在高标签噪声条件下,所提方法是否在泛化性能上优于现有重加权和正则化技术?
  • RQ3该方法是否能以极低的内存和计算开销高效实现,适用于大规模和流式训练场景?
  • RQ4在理论基础和实证性能方面,该方法与标签平滑及其他启发式方法相比如何?
  • RQ5该方法是否能与数据增强技术(如Mixup)有效结合,进一步提升鲁棒性?

主要发现

  • 所提出的CIW和CICW方法在CIFAR-10和CIFAR-100等标准基准上,在对称和非对称标签噪声设置下均取得显著性能提升。
  • 在CIFAR-10上40%对称标签噪声下,CIW-ELR的测试准确率达到78.5%,优于Bi-tempered(76.2%)和APNL(75.1%)。
  • 该方法对超参数变化具有鲁棒性,不同设置下的测试准确率波动在约2.5%以内。
  • CICW-Mixup(Dyn-CICW-M)在CIFAR-100上40%非对称噪声下达到最先进结果,优于标准Mixup和其他基线方法。
  • 该框架为标签自举及其他启发式方法提供了理论基础,表明它们在特定分歧选择下自然成为特例。
  • 该方法无需额外前向传播或辅助网络,且内存使用量低,适用于大规模和流式应用场景。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。