Skip to main content
QUICK REVIEW

[论文解读] Boosting Co-teaching with Compression Regularization for Label Noise

Yingyi Chen, Xi Shen|arXiv (Cornell University)|Apr 28, 2021
Machine Learning and Data Classification参考文献 29被引用 7
一句话总结

该论文提出了一种两阶段方法,将嵌套丢弃(Nested Dropout)——一种用于有序特征学习的压缩正则化方法——与协同教学(Co-teaching)相结合,以提升图像分类任务中对标签噪声的鲁棒性。通过利用有序特征实现信噪分离,并结合迭代的干净样本选择,该方法在 Clothing1M 上实现了 74.9% 的最先进准确率,在 ANIMAL-10N 上达到了 84.1%,优于先前的方法,包括 DivideMix 和 PLC。

ABSTRACT

In this paper, we study the problem of learning image classification models in the presence of label noise. We revisit a simple compression regularization named Nested Dropout. We find that Nested Dropout, though originally proposed to perform fast information retrieval and adaptive data compression, can properly regularize a neural network to combat label noise. Moreover, owing to its simplicity, it can be easily combined with Co-teaching to further boost the performance. Our final model remains simple yet effective: it achieves comparable or even better performance than the state-of-the-art approaches on two real-world datasets with label noise which are Clothing1M and ANIMAL-10N. On Clothing1M, our approach obtains 74.9% accuracy which is slightly better than that of DivideMix. On ANIMAL-10N, we achieve 84.1% accuracy while the best public result by PLC is 83.4%. We hope that our simple approach can be served as a strong baseline for learning with label noise. Our implementation is available at https://github.com/yingyichen-cyy/Nested-Co-teaching.

研究动机与目标

  • 为解决在大规模带噪声标签数据集上训练深度神经网络的挑战,这类数据在真实世界网络爬取数据中普遍存在。
  • 探究压缩正则化,特别是嵌套丢弃(Nested Dropout),是否可作为学习带噪声标签的强基线方法。
  • 通过使用嵌套丢弃提升协同教学中样本选择的可靠性,从而增强协同教学的性能。
  • 为未来关于带噪声标签学习的研究提供一种简单、有效且易于部署的基线方法。

提出的方法

  • 在每层中仅保留前 k 个特征通道,通过从类似正态分布的分布中采样 k,来学习有序特征表示,从而优先保留信息量高的特征。
  • 采用参数化分布来表示 k,即 p_k ∝ exp(−k²/(2σ²_nest)),在训练过程中实现自适应、结构化的低信息量特征剪枝。
  • 在第一阶段,训练两个使用嵌套丢弃的独立网络,作为后续协同教学微调的可靠基础模型。
  • 在第二阶段,应用协同教学对两个预训练模型进行微调,其中每个网络仅使用其同伴网络预测的低损失样本进行自身更新。
  • 该方法整合了压缩正则化与样本选择策略,结合了两种范式的优点,且无需复杂的超参数调优。
  • 该方法在 Clothing1M 上应用于 ResNet-50,在 ANIMAL-10N 上应用于 VGG-19,采用标准训练协议,并在协同教学阶段对学习率进行微调。

实验结果

研究问题

  • RQ1原本设计用于数据压缩的嵌套丢弃,能否有效正则化深度网络,以减轻标签噪声的影响?
  • RQ2通过嵌套丢弃学习到的有序特征表示,是否能在噪声数据中实现更好的信噪分离?
  • RQ3嵌套丢弃与协同教学的结合是否能在真实世界带噪声数据集上超越现有最先进方法?
  • RQ4所提出方法的性能对超参数 σ_nest 的选择有多鲁棒?

主要发现

  • 在 Clothing1M 上,该方法实现了 74.9% 的 top-1 准确率,超越了最先进方法 DivideMix。
  • 在 ANIMAL-10N 上,该方法达到 84.1% 的准确率,比 PLC 的最佳公开结果 83.4% 提高了 0.7 个百分点。
  • 仅使用原始特征通道数不足 1% 的情况下,嵌套丢弃本身即显著优于标准交叉熵训练和标准丢弃,性能更优。
  • 消融实验表明,嵌套丢弃带来的性能增益在不同 σ_nest 值下均具有鲁棒性,最优 k* 值表明特征利用效率高。
  • 协同教学微调在所有配置下均持续提升性能,证明了两阶段训练策略的有效性。
  • 最终模型保持简单高效,通过合理方式结合两种成熟技术,无需复杂架构或超参数调优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。