Skip to main content
QUICK REVIEW

[论文解读] Supercharging Imbalanced Data Learning With Energy-based Contrastive Representation Transfer.

Junya Chen, Zidi Xiu|PubMed|Dec 1, 2021
Imbalanced Data Classification Techniques参考文献 14被引用 8
一句话总结

本文提出了一种基于能量的因果表征迁移(ECRT)方法,这是一种新颖的不平衡数据学习方法,利用因果不变性通过基于能量的对比学习,将多数类的知识迁移至少数类。通过从多数样本中建模共享的、不变的源表征,ECRT 实现了高效且可泛化的数据增强,并在 CIFAR100 上取得了 0.482 的 F1 分数,显著高于 ERM(0.439)和 LDAM(0.408)。

ABSTRACT

Dealing with severe class imbalance poses a major challenge for many real-world applications, especially when the accurate classification and generalization of minority classes are of primary interest. In computer vision and NLP, learning from datasets with long-tail behavior is a recurring theme, especially for naturally occurring labels. Existing solutions mostly appeal to sampling or weighting adjustments to alleviate the extreme imbalance, or impose inductive bias to prioritize generalizable associations. Here we take a novel perspective to promote sample efficiency and model generalization based on the invariance principles of causality. Our contribution posits a meta-distributional scenario, where the causal generating mechanism for label-conditional features is invariant across different labels. Such causal assumption enables efficient knowledge transfer from the dominant classes to their under-represented counterparts, even if their feature distributions show apparent disparities. This allows us to leverage a causal data augmentation procedure to enlarge the representation of minority classes. Our development is orthogonal to the existing imbalanced data learning techniques thus can be seamlessly integrated. The proposed approach is validated on an extensive set of synthetic and real-world tasks against state-of-the-art solutions.

研究动机与目标

  • 解决现实世界机器学习中严重的类别不平衡问题,特别是在少数类泛化至关重要的情况下。
  • 克服现有方法(如 ERM、重加权和采样)的局限性,这些方法常因在少数样本上过拟合而难以泛化。
  • 利用因果不变性原则,识别在标签间共享的、解耦的源表征,即使特征分布不同亦可实现。
  • 开发一种基于因果表征迁移的数据增强策略,提升低数据场景下的样本效率和模型鲁棒性。
  • 将对比学习与能量建模及弱监督学习相结合,构建一个灵活且可泛化的不平衡数据学习框架。

提出的方法

  • 构建一种元分布场景,其中标签条件特征的因果生成机制在不同标签间保持不变,从而实现从多数类到少数类的知识迁移。
  • 仅使用多数类样本训练特征编码器,通过基于能量的对比学习学习解耦的、不变的源表征。
  • 利用学习到的源表征构建参数化增强分布,生成多样化且真实的合成少数类样本。
  • 应用对比学习目标,通过最小化真实与增强表征之间的分布差异,促使模型保持因果不变性。
  • 使用能量建模定义表征上的得分函数,实现对比目标的高效且稳定优化。
  • 将方法与标准训练流程集成,支持无缝插件至现有模型和损失函数,无需架构重构。

实验结果

研究问题

  • RQ1尽管存在明显的分布差异,能否利用因果不变性原则将知识从多数类迁移至少数类?
  • RQ2基于能量的对比学习在不平衡数据的低样本场景下,如何提升表征迁移与泛化能力?
  • RQ3基于不变源表征的参数化数据增强在少数类学习中,相较于标准增强,性能提升程度如何?
  • RQ4所提出方法在具有数千个稀有类别且每类仅少数样本的极端分类设置下是否具有泛化能力?
  • RQ5因果性、对比学习与能量建模的融合是否在多种基准数据集上均带来一致的性能提升?

主要发现

  • 在 CIFAR100 数据集上,ECRT 取得了 0.482 的 F1 分数,显著优于 ERM(0.439)、LDAM(0.408)、FOCAL(0.391)和 SMOTE(0.444)。
  • 在 iNaturalist 数据集上,ECRT 在所有标签频率区间均持续优于 ERM 和 LDAM,尤其在低样本场景下表现更优。
  • 基于 ECRT 源空间建模的参数化增强方法带来了最大的性能提升,而当少数样本稀缺时,更强的增强反而可能降低性能。
  • 消融实验表明,仅在多数类上预训练特征编码器可获得更优性能(top-1: 51.79),优于包含少数类数据的训练,表明少数类数据可能引入虚假特征。
  • ECRT 在极端分类任务中表现良好,标签数量极低时仍优于 ERM,且在 ERM 仅略好于随机猜测的情况下仍能实现有意义的性能。
  • t-SNE 可视化结果证实,ECRT 学习到的表征更具解耦性与泛化能力,使用增强数据后少数类的聚类效果更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。