[论文解读] Learning From Long-Tailed Data With Noisy Labels
该论文提出了一种两阶段方法,首先通过自监督预训练从长尾分布和噪声数据中学习鲁棒表征,随后结合对数调整(Logit Adjustment)与SuperLoss进行微调,以同时解决类别不平衡与标签噪声问题。该方法在CIFAR-10/100的合成噪声与长尾设置下,以及在真实世界Clothing-1M数据集上,均取得了最先进性能,展现出对严重数据挑战的强大鲁棒性。
Class imbalance and noisy labels are the norm rather than the exception in many large-scale classification datasets. Nevertheless, most works in machine learning typically assume balanced and clean data. There have been some recent attempts to tackle, on one side, the problem of learning from noisy labels and, on the other side, learning from long-tailed data. Each group of methods make simplifying assumptions about the other. Due to this separation, the proposed solutions often underperform when both assumptions are violated. In this work, we present a simple two-stage approach based on recent advances in self-supervised learning to treat both challenges simultaneously. It consists of, first, task-agnostic self-supervised pre-training, followed by task-specific fine-tuning using an appropriate loss. Most significantly, we find that self-supervised learning approaches are effectively able to cope with severe class imbalance. In addition, the resulting learned representations are also remarkably robust to label noise, when fine-tuned with an imbalance- and noise-resistant loss function. We validate our claims with experiments on CIFAR-10 and CIFAR-100 augmented with synthetic imbalance and noise, as well as the large-scale inherently noisy Clothing-1M dataset.
研究动机与目标
- 为解决现实世界数据集中长期存在的长尾类别分布与标签噪声问题,而这些问题在以往工作中常被分开处理。
- 探究自监督表征学习是否能在无需显式重加权或采样策略的情况下,天然地处理严重类别不平衡问题。
- 开发一种统一的训练流程,对标签噪声与长尾数据均具有鲁棒性,克服现有方法在假设标签干净或数据平衡时的局限性。
- 验证在自监督预训练后,于微调阶段结合对数调整(用于长尾学习)与SuperLoss(用于噪声标签)的有效性。
提出的方法
- 该方法采用两阶段训练流程:首先使用对比学习框架(如SimCLR、Barlow Twins、BYOL、SimSiam)进行自监督预训练,期间不使用标签。
- 在预训练阶段,模型通过对比同一图像的增强视图学习不变表征,即使在强类别不平衡条件下也表现出色。
- 在第二阶段,使用对数调整损失(用于缓解对主导类别偏差)与SuperLoss(用于减少对噪声标签的记忆化)的组合对预训练模型进行微调。
- 微调阶段使用原始的噪声标签与长尾分布训练标签,损失函数专门设计用于处理数据不平衡与标签噪声问题。
- 该方法借鉴了半监督学习的最新洞见:自监督预训练可在监督微调前提升泛化能力与鲁棒性。
- 该方法在多个基准上进行了评估:CIFAR-10与CIFAR-100的合成不平衡与噪声设置,以及具有固有噪声与长尾分布的真实世界Clothing-1M数据集。
实验结果
研究问题
- RQ1自监督表征学习是否能在无需显式数据平衡的情况下,有效处理长尾数据分布?
- RQ2对数调整与SuperLoss的结合在同时存在标签噪声与类别不平衡时,如何提升模型鲁棒性?
- RQ3两阶段方法(自监督预训练后接鲁棒微调)是否在联合长尾与噪声标签设置下优于现有最先进方法?
- RQ4不同自监督方法(如SimCLR、BYOL、SimSiam)在严重数据不平衡与标签噪声下,其泛化能力如何?
主要发现
- 自监督预训练对类别不平衡具有显著鲁棒性,所有测试方法(SimCLR、Barlow Twins、BYOL、SimSiam)在极端不平衡比例下均表现出相似性能。
- 所提出的两阶段方法在CIFAR-10与CIFAR-100的合成噪声与不平衡设置下,显著优于现有最先进基线方法,尤其在高噪声水平与严重类别不平衡条件下优势明显。
- 在真实世界Clothing-1M数据集上(约38.5%的噪声标签,类别不平衡比约5:1),该方法取得了最先进准确率,证明其在真实场景下的强大泛化能力。
- 在微调阶段结合对数调整与SuperLoss,能有效缓解对主导类别的偏差,并防止对噪声标签的记忆化,从而显著提升罕见类别上的性能。
- 专为干净数据或平衡数据设计的现有方法在同时存在噪声与不平衡时性能显著下降,凸显了联合处理的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。