[论文解读] Augmentation Strategies for Learning with Noisy Labels
该论文提出了一种名为增强梯度(Augmented Descent, AugDesc)的两阶段增强策略,利用弱增强进行损失建模和伪标签生成,并在反向传播过程中使用强增强(如AutoAugment)以提升泛化能力。在90%对称标签噪声的CIFAR-10数据集上,该方法实现了15.1%的绝对准确率提升,并在CIFAR-10和Clothing1M等合成与真实世界数据集上,显著提升了多种最先进方法的性能。
Imperfect labels are ubiquitous in real-world datasets. Several recent successful methods for training deep neural networks (DNNs) robust to label noise have used two primary techniques: filtering samples based on loss during a warm-up phase to curate an initial set of cleanly labeled samples, and using the output of a network as a pseudo-label for subsequent loss calculations. In this paper, we evaluate different augmentation strategies for algorithms tackling the "learning with noisy labels" problem. We propose and examine multiple augmentation strategies and evaluate them using synthetic datasets based on CIFAR-10 and CIFAR-100, as well as on the real-world dataset Clothing1M. Due to several commonalities in these algorithms, we find that using one set of augmentations for loss modeling tasks and another set for learning is the most effective, improving results on the state-of-the-art and other previous methods. Furthermore, we find that applying augmentation during the warm-up period can negatively impact the loss convergence behavior of correctly versus incorrectly labeled samples. We introduce this augmentation strategy to the state-of-the-art technique and demonstrate that we can improve performance across all evaluated noise levels. In particular, we improve accuracy on the CIFAR-10 benchmark at 90% symmetric noise by more than 15% in absolute accuracy, and we also improve performance on the Clothing1M dataset. (K. Nishi and Y. Ding contributed equally to this work)
研究动机与目标
- 探究不同数据增强策略对噪声标签学习(LNL)的影响,特别是与损失收敛性和记忆化行为的关系。
- 解决在预热阶段过度增强会破坏网络基于损失动态区分干净样本与噪声样本能力的挑战。
- 开发一种可泛化的增强策略,可在无需超参数调优的情况下提升多种LNL算法的性能。
- 评估强增强、学习型增强策略(如AutoAugment)在提升模型泛化能力的同时,是否能保留早期阶段干净样本与噪声样本之间损失分离的关键特性。
- 证明将增强功能分离——弱增强用于损失建模,强增强用于训练——可在不同噪声水平和数据集上实现一致的性能提升。
提出的方法
- 提出增强梯度(AugDesc),一种双增强策略,将增强使用解耦:弱增强用于损失计算和伪标签生成,强增强用于反向传播。
- 采用两阶段训练协议:在预热阶段仅使用弱增强,以保留干净样本与噪声样本之间的损失差异;后期引入强增强以提升泛化能力。
- 使用AutoAugment和RandAugment策略生成强增强,避免人工设计,实现数据驱动的策略学习。
- 将该策略应用于多种SOTA LNL方法(如Co-Teaching+、M-DYR-H、DivideMix),无需超参数调优,证明其泛化能力与易集成性。
- 分析训练过程中损失分布的变化,验证在预热阶段使用强增强会破坏记忆化效应,而延迟使用则可保留该效应。
- 使用带有对称与非对称噪声的合成数据集(CIFAR-10、CIFAR-100)以及真实世界Clothing1M数据集,评估不同噪声水平与数据分布下的性能表现。

实验结果
研究问题
- RQ1在LNL的预热阶段,数据增强的时机与强度如何影响干净样本与噪声样本的损失收敛行为?
- RQ2更强的、学习型的增强策略(如AutoAugment)是否能在不破坏记忆化效应(即干净数据先于噪声数据被学习)的前提下,提升LNL中的泛化能力?
- RQ3整合多种增强策略的最优策略是什么?具体而言,弱增强与强增强应在训练流程中如何实现时序与功能上的分离?
- RQ4所提出的增强策略在无需模型特定超参数调优的情况下,能在多大程度上提升多种LNL算法的性能?
- RQ5与现有SOTA技术相比,该方法在不同噪声水平和真实世界数据集(如Clothing1M)上的泛化能力如何?
主要发现
- 在预热阶段应用强增强会严重破坏干净样本与噪声样本之间的损失差异,从而破坏LNL方法的核心假设——即干净数据先于噪声数据被学习。
- AugDesc-WS-WAW策略——即使用弱增强进行损失建模,强增强用于反向传播——在90%对称标签噪声的CIFAR-10数据集上实现了15.1%的绝对准确率提升,显著优于基线方法。
- 在真实世界Clothing1M数据集上,所提出的增强策略在所有评估的噪声水平下均提升了性能,证明了其在实际场景中的鲁棒性。
- 当应用于现有SOTA方法(如Co-Teaching+、M-DYR-H、DivideMix)时,无需超参数调优,该增强策略使准确率最高提升了5%(绝对值)。
- 在训练最后几轮的平均性能始终高于未使用增强的设置,表明模型学习到了更优的决策边界。
- 研究证实,使用两个独立的增强池——一个用于损失建模,一个用于训练——可带来更好的泛化能力与更稳定的训练动态,尤其在噪声标签场景下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。