Skip to main content
QUICK REVIEW

[论文解读] Learning Fast Sample Re-weighting Without Reward Data

Zizhao Zhang, Tomas Pfister|arXiv (Cornell University)|Sep 7, 2021
Machine Learning and Data Classification参考文献 60被引用 8
一句话总结

本文提出快速样本重加权(FSR),一种新颖的基于学习的方法,通过利用动态代理奖励词典和模型与权重优化之间的特征共享,消除了对外部奖励数据的依赖,并降低了训练成本。FSR在标签噪声鲁棒性和长尾识别任务中达到最先进性能,且训练效率显著提升,优于先前方法,无需额外的无偏验证数据。

ABSTRACT

Training sample re-weighting is an effective approach for tackling data biases such as imbalanced and corrupted labels. Recent methods develop learning-based algorithms to learn sample re-weighting strategies jointly with model training based on the frameworks of reinforcement learning and meta learning. However, depending on additional unbiased reward data is limiting their general applicability. Furthermore, existing learning-based sample re-weighting methods require nested optimizations of models and weighting parameters, which requires expensive second-order computation. This paper addresses these two problems and presents a novel learning-based fast sample re-weighting (FSR) method that does not require additional reward data. The method is based on two key ideas: learning from history to build proxy reward data and feature sharing to reduce the optimization cost. Our experiments show the proposed method achieves competitive results compared to state of the arts on label noise robustness and long-tailed recognition, and does so while achieving significantly improved training efficiency. The source code is publicly available at https://github.com/google-research/google-research/tree/master/ieg.

研究动机与目标

  • 解决现有基于学习的样本重加权方法对外部无偏奖励数据的依赖问题,从而限制其通用性。
  • 降低元学习框架中基于二阶优化的高计算成本。
  • 开发一种快速、高效且可泛化的样本重加权方法,适用于大规模深度学习。
  • 证明基于训练历史构建的优质代理奖励信号可替代外部奖励数据。
  • 通过动量重新标注和MixUp等正交增强手段,提升在标签噪声和长尾识别中的鲁棒性。

提出的方法

  • 该方法从模型更新历史中构建代表性训练样本的动态词典,作为代理奖励数据,从而消除对外部验证集的依赖。
  • 基于元边际的估值函数用于从词典中识别高质量样本作为权重优化的代理奖励。
  • 在模型与权重优化之间引入特征共享,通过重用共享表征来降低内存和计算成本。
  • 采用基于动量的重新标注机制,在噪声环境下提升标签质量,增强代理奖励的可靠性。
  • 应用MixUp正则化以提升词典和推送函数的质量,从而实现更好的泛化性和权重稀疏性。
  • 整个框架通过随机梯度下降端到端训练,避免嵌套或二阶优化。

实验结果

研究问题

  • RQ1能否从训练历史中提取的代理奖励信号替代元学习框架中基于学习的样本重加权的外部奖励数据?
  • RQ2与现有依赖奖励的重加权方法相比,所提方法在性能和效率方面表现如何?
  • RQ3特征共享在联合模型与权重优化中在多大程度上降低了训练成本?
  • RQ4动量重新标注与MixUp的结合在提升对标签噪声鲁棒性方面效果如何?
  • RQ5该方法在真实世界数据分布中,对不同词典大小和噪声水平是否具有鲁棒性?

主要发现

  • FSR在CIFAR-10和CIFAR-100上实现具有竞争力的性能,即使在高达80%的均匀标签噪声下,仍能保持高准确率,且无需外部奖励数据。
  • 该方法对词典大小不敏感,性能在不同大小下保持稳定,而依赖奖励的方法则因数据稀缺而表现下降。
  • 在引入MixUp和动量重新标注后,FSR在CIFAR-10上20%均匀噪声下达到68.1%准确率,40%噪声下达到60.9%,优于基线方法。
  • FSR中零权重的比例与实际噪声比例高度一致,表明其有效抑制了噪声样本。
  • FSR-Raw(无MixUp和动量重新标注)的性能与L2R在任意奖励数据规模下的表现相当,证明外部奖励数据并非必需。
  • MixUp显著提升了词典的纯净度和最终准确率,表明其作用不仅限于数据增强,更具有正则化效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。