Skip to main content
QUICK REVIEW

[论文解读] Open-Sampling: Exploring Out-of-Distribution data for Re-balancing Long-tailed datasets

Hongxin Wei, Lue Tao|arXiv (Cornell University)|Jun 17, 2022
Domain Adaptation and Few-Shot Learning被引用 15
一句话总结

本文提出了一种名为 Open-sampling 的新方法,通过利用分布外(OOD)数据并赋予其合成的噪声标签,借助互补分布对类别先验进行对齐,从而重新平衡长尾数据集。该方法显著提升了少数类的性能和泛化能力,在长尾学习中优于当前最先进方法,并在类别不平衡条件下实现了强大的 OOD 检测能力。

ABSTRACT

Deep neural networks usually perform poorly when the training dataset suffers from extreme class imbalance. Recent studies found that directly training with out-of-distribution data (i.e., open-set samples) in a semi-supervised manner would harm the generalization performance. In this work, we theoretically show that out-of-distribution data can still be leveraged to augment the minority classes from a Bayesian perspective. Based on this motivation, we propose a novel method called Open-sampling, which utilizes open-set noisy labels to re-balance the class priors of the training dataset. For each open-set instance, the label is sampled from our pre-defined distribution that is complementary to the distribution of original class priors. We empirically show that Open-sampling not only re-balances the class priors but also encourages the neural network to learn separable representations. Extensive experiments demonstrate that our proposed method significantly outperforms existing data re-balancing methods and can boost the performance of existing state-of-the-art methods.

研究动机与目标

  • 为解决长尾数据集中少数类模型泛化能力差的问题,因为现实世界数据本身存在固有不平衡。
  • 探索分布外(OOD)数据的未开发潜力——此前在半监督学习中被认为有害——用于长尾学习中的数据再平衡。
  • 开发一种方法,通过使用互补标签分布和类别相关加权,利用 OOD 数据而不引起过拟合。
  • 为将 OOD 数据作为辅助数据源以提升模型鲁棒性和表示学习提供实证和理论依据。
  • 为长尾学习中选择有效的开放集辅助数据集提供实用指导。

提出的方法

  • 提出 Open-sampling 方法,通过从预定义的与原始类别先验互补的分布中采样 OOD 样本,并为其分配合成的噪声标签。
  • 在损失函数中采用类别相关加权策略,对少数类提供更强的正则化,减轻对 OOD 噪声的过拟合。
  • 互补分布被设计为比标准类别平衡分布更接近均匀分布,从而降低 OOD 标签的有害性。
  • 从贝叶斯视角出发,证明 OOD 数据可改善先验再平衡并提升表示可分性。
  • 使用大规模、真实的 OOD 数据集作为辅助数据,强调样本数量和真实感,而非类别多样性。
  • 可无缝集成到现有的最先进长尾学习方法中,无需架构修改即可提升性能。

实验结果

研究问题

  • RQ1能否在不损害模型泛化能力的前提下,有效利用分布外(OOD)数据来重新平衡长尾数据集?
  • RQ2OOD 样本标签分布的选择如何影响模型性能和鲁棒性?
  • RQ3辅助 OOD 数据集的哪些特性(如规模、多样性、真实性)对有效再平衡最为关键?
  • RQ4Open-sampling 是否不仅提升长尾分类性能,也提升分布外(OOD)检测性能?
  • RQ5Open-sampling 是否可作为即插即用模块,用于增强现有最先进长尾学习方法?

主要发现

  • Open-sampling 在四个长尾基准数据集(CIFAR-10/100、CelebA-5 和 Places-LT)上显著优于现有数据再平衡方法。
  • 与基线方法相比,该方法将少数类的平均准确率提升了高达 12.5%,且在所有数据集上均保持一致的增益。
  • 与使用类别平衡分布相比,采用互补标签分布可获得更优性能,因其降低了 OOD 噪声的负面影响。
  • 样本量大且真实的 OOD 数据集效果最佳,而类别多样性的重要性低于数据真实感和规模。
  • Open-sampling 提升了学习表示的可分性,通过改进特征聚类和边际分析得到验证。
  • 在类别不平衡设置下,该方法在 OOD 检测任务中也达到了最先进性能,即使在训练标签存在噪声时亦然。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。