[论文解读] Two Wrongs Don't Make a Right: Combating Confirmation Bias in Learning with Label Noise
本文提出稳健标签修复(Robust LR),一种混合方法,通过两模型协同训练框架动态结合置信度估计的噪声标签与伪标签,缓解确认偏误与标签噪声问题。该方法在CIFAR-10的合成噪声数据以及Mini-WebVision和ANIMAL-10N等真实世界数据集上均取得最先进性能,通过置信度感知与增强鲁棒性训练,联合优化标签并减少误差累积。
Noisy labels damage the performance of deep networks. For robust learning, a prominent two-stage pipeline alternates between eliminating possible incorrect labels and semi-supervised training. However, discarding part of noisy labels could result in a loss of information, especially when the corruption has a dependency on data, e.g., class-dependent or instance-dependent. Moreover, from the training dynamics of a representative two-stage method DivideMix, we identify the domination of confirmation bias: pseudo-labels fail to correct a considerable amount of noisy labels, and consequently, the errors accumulate. To sufficiently exploit information from noisy labels and mitigate wrong corrections, we propose Robust Label Refurbishment (Robust LR) a new hybrid method that integrates pseudo-labeling and confidence estimation techniques to refurbish noisy labels. We show that our method successfully alleviates the damage of both label noise and confirmation bias. As a result, it achieves state-of-the-art performance across datasets and noise types, namely CIFAR under different levels of synthetic noise and Mini-WebVision and ANIMAL-10N with real-world noise.
研究动机与目标
- 解决两阶段标签噪声学习流水线的局限性,后者会丢弃潜在有用的噪声标签并遭受确认偏误影响。
- 识别并缓解半监督学习中因错误伪标签持续强化而引发的确认偏误问题。
- 开发一种方法,通过置信度估计与伪标签化动态优化噪声标签,充分挖掘其价值。
- 提升对各类噪声类型(包括对称型、类别相关型与实例相关型)的鲁棒性。
- 利用模型置信度估计实现在真实世界数据集中准确检测噪声标签。
提出的方法
- Robust LR采用双学生网络的协同训练框架,相互生成伪标签并相互优化预测结果。
- 基于每个样本的置信度(通过在训练损失上使用高斯混合模型(GMM)估计)对噪声标签与伪标签进行动态凸组合。
- 在损失建模与最终训练阶段采用不同的数据增强策略,提升泛化能力与鲁棒性。
- 通过GMM对每个样本损失的分布进行建模,实现置信度估计,为可靠预测分配更高权重。
- 框架不丢弃任何标签,保留了噪声标签中潜在的有用信息。
- 在统一的端到端训练过程中整合置信度估计与伪标签化,以减少误差累积。
实验结果
研究问题
- RQ1确认偏误在两阶段标签噪声学习流水线中如何表现?其对模型性能有何影响?
- RQ2一种保留全部噪声标签并结合置信度估计与伪标签化的混合方法,是否能超越现有两阶段方法?
- RQ3两模型之间的协同训练在多大程度上可减少确认偏误并提升标签优化效果?
- RQ4Robust LR在真实世界数据集(如CIFAR-10)中检测错误标注样本的效能如何?
- RQ5强数据增强与置信度估计在方法鲁棒性中分别发挥何种作用?
主要发现
- 在CIFAR-10的90%对称噪声设置下,Robust LR达到96.4%的测试准确率,性能超越先前方法,达到最先进水平。
- 在包含真实世界噪声的Mini-WebVision与ANIMAL-10N数据集中,Robust LR分别取得95.7%与94.3%的准确率,展现出强大的泛化能力。
- 消融实验表明,若移除强数据增强,性能分别下降至92.6%(最佳)与72.7%(最差),表明其在模型收敛中具有关键作用。
- 基于GMM的置信度估计能准确估计噪声率,在90%噪声率下为78%的样本分配更高的噪声概率,非常接近真实值81%。
- 移除协同训练导致性能显著下降:从96.4%降至95.6%(最佳);从95.7%降至94.4%(最差),证实其在缓解确认偏误中的关键作用。
- Robust LR成功识别出CIFAR-10训练集中50个错误标注或模糊的样本,包括鸟类与飞机、狗与猫等高难度分类案例。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。