[论文解读] Robust and On-the-fly Dataset Denoising for Image Classification
本文提出了一种名为在线数据去噪(On-the-fly Data Denoising, ODD)的方法,利用随机梯度下降(SGD)在大学习率下的隐式正则化,实现对图像分类数据集中错误标注样本的鲁棒、高效识别与去除。ODD 仅通过网络参数建模均匀随机标签的反事实损失分布,随后移除损失超过该分布高分位数的样本,从而在 WebVision 和 Clothing1M 等噪声数据集上实现最先进性能,且计算开销几乎为零。
Memorization in over-parameterized neural networks could severely hurt generalization in the presence of mislabeled examples. However, mislabeled examples are hard to avoid in extremely large datasets collected with weak supervision. We address this problem by reasoning counterfactually about the loss distribution of examples with uniform random labels had they were trained with the real examples, and use this information to remove noisy examples from the training set. First, we observe that examples with uniform random labels have higher losses when trained with stochastic gradient descent under large learning rates. Then, we propose to model the loss distribution of the counterfactual examples using only the network parameters, which is able to model such examples with remarkable success. Finally, we propose to remove examples whose loss exceeds a certain quantile of the modeled loss distribution. This leads to On-the-fly Data Denoising (ODD), a simple yet effective algorithm that is robust to mislabeled examples, while introducing almost zero computational overhead compared to standard training. ODD is able to achieve state-of-the-art results on a wide range of datasets including real-world ones such as WebVision and Clothing1M.
研究动机与目标
- 解决大规模弱监督数据集中因错误标注样本导致的模型泛化性能下降问题。
- 开发一种不依赖标签噪声分布先验知识或可信样本的去噪方法。
- 实现在训练过程中低计算成本的高效、实时噪声样本移除。
- 在真实世界噪声数据集和干净基准测试集上均提升性能,且无需修改网络架构或超参数。
提出的方法
- ODD 在初始训练阶段使用大学习率调度,以在干净样本与均匀噪声样本之间形成显著的损失差距。
- 仅利用训练后的网络参数,对均匀随机标签的反事实损失分布进行建模,无需实际在噪声标签上进行训练。
- 从该建模损失分布的高分位数(如第 95 百分位数)中推导出阈值,以识别潜在错误标注的样本。
- 损失超过该阈值的样本被实时从训练集中移除,训练在清理后的数据集上继续进行。
- 该方法对原始标签分布无偏见,无需事先知晓噪声水平或混淆矩阵。
- ODD 在微调阶段应用,可无缝集成至标准训练流程,计算开销可忽略不计。
实验结果
研究问题
- RQ1SGD 在大学习率下产生的隐式正则化是否可用于区分错误标注样本与干净样本?
- RQ2能否仅通过网络参数对均匀随机标签的反事实损失分布进行建模?
- RQ3通过移除该反事实损失分布中高于分位数的样本,是否能提升在噪声数据集上的泛化性能?
- RQ4ODD 对学习率调度和剪枝比例等超参数的变化是否具有鲁棒性?
- RQ5ODD 是否能在无任何外部监督的情况下,在‘干净’数据集(如 CIFAR-100)中检测到错误标注样本?
主要发现
- ODD 在真实世界噪声数据集(如 WebVision 和 Clothing1M)上实现了最先进准确率,优于需要噪声转移矩阵或辅助模型的方法。
- 在 WebVision 数据集上,ODD 达到 78.9% 的 top-1 准确率,超越了 GCE 和联合优化等先前方法。
- 在 Clothing1M 数据集上,ODD 实现 88.7% 的 top-1 准确率,优于 LCCN 和 DMI 等方法,并与 LC 方法相当或更优,尽管 LC 方法依赖于干净标签。
- ODD 在干净数据集(如 CIFAR-10 和 ImageNet)上也保持了具有竞争力的性能,其结果与标准经验风险最小化(ERM)训练相当。
- 消融实验表明,ODD 对剪枝比例(p)和训练周期数(E)的变化具有鲁棒性,其中 p=10 和 E=100 时取得最佳权衡。
- 定性分析证实,ODD 在无任何真实噪声标签的情况下,仍能成功识别 CIFAR-100 数据集中错误标注的样本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。