Skip to main content
QUICK REVIEW

[论文解读] An Embarrassingly Simple Baseline for Imbalanced Semi-Supervised Learning

Hao Chen, Yue Fan|arXiv (Cornell University)|Nov 20, 2022
Advanced Neural Network Applications被引用 4
一句话总结

本文提出 SimiS,一种用于类别不平衡半监督学习的简单而高效的基线方法,通过基于最常见类别频率差异的伪标签增强有标签数据来减轻类别不平衡。该方法在 CIFAR100-LT、FOOD101-LT 和 ImageNet127 上分别超越先前方法 12.8%、13.6% 和 16.7%,实现更快速的收敛速度和更高的伪标签准确率。

ABSTRACT

Semi-supervised learning (SSL) has shown great promise in leveraging unlabeled data to improve model performance. While standard SSL assumes uniform data distribution, we consider a more realistic and challenging setting called imbalanced SSL, where imbalanced class distributions occur in both labeled and unlabeled data. Although there are existing endeavors to tackle this challenge, their performance degenerates when facing severe imbalance since they can not reduce the class imbalance sufficiently and effectively. In this paper, we study a simple yet overlooked baseline -- SimiS -- which tackles data imbalance by simply supplementing labeled data with pseudo-labels, according to the difference in class distribution from the most frequent class. Such a simple baseline turns out to be highly effective in reducing class imbalance. It outperforms existing methods by a significant margin, e.g., 12.8%, 13.6%, and 16.7% over previous SOTA on CIFAR100-LT, FOOD101-LT, and ImageNet127 respectively. The reduced imbalance results in faster convergence and better pseudo-label accuracy of SimiS. The simplicity of our method also makes it possible to be combined with other re-balancing techniques to improve the performance further. Moreover, our method shows great robustness to a wide range of data distributions, which holds enormous potential in practice. Code will be publicly available.

研究动机与目标

  • 为解决半监督学习中存在严重类别不平衡的问题,即有标签和无标签数据均呈现偏斜的类别分布。
  • 提出一种简单但高效的基线方法,在无需复杂重加权或网络结构修改的情况下缓解类别不平衡。
  • 证明一种直接的方法——基于类别频率差异将伪标签补充到有标签数据中——可显著超越现有最先进方法。
  • 展示该方法在多种数据分布下的鲁棒性,并可与其他重平衡技术兼容。

提出的方法

  • SimiS 通过基于最常见类别相对频率差异生成并整合伪标签到有标签集合中,以减轻类别不平衡。
  • 该方法采用简单启发式策略:对于每个类别,添加的伪标签数量与其相对于最常见类别的频率的倒数成正比。
  • 使用标准 SSL 训练流程,基于增强后的有标签集合进行训练,保持与基线 SSL 方法相同的训练流程。
  • 该方法无需额外超参数或复杂的损失重加权,仅依赖类别频率统计信息。
  • 它利用 SSL 中伪标签的一致性,以提升标签质量和模型泛化能力。
  • 该方法与现有 SSL 框架兼容,可与其他重平衡技术结合以获得进一步性能提升。

实验结果

研究问题

  • RQ1一种简单且非学习的伪标签化启发式方法是否能显著减轻半监督学习中的类别不平衡?
  • RQ2在严重类别不平衡条件下,SimiS 在性能和收敛速度方面与最先进方法相比如何?
  • RQ3SimiS 在不同数据分布和不平衡程度下的鲁棒性如何?
  • RQ4SimiS 是否能与其它重平衡技术有效结合以进一步提升性能?

主要发现

  • 在长尾数据分布下,SimiS 在 CIFAR100-LT 上超越先前最先进方法 12.8%,在 FOOD101-LT 上提升 13.6%,在 ImageNet127 上提升 16.7%。
  • 由于训练数据中类别不平衡减少,该方法实现了更快的收敛速度。
  • 伪标签准确率显著提高,因为平衡的数据分布使训练期间的预测更加可靠。
  • SimiS 在广泛范围的数据不平衡水平和分布下表现出强鲁棒性。
  • 该方法的简洁性使其可无缝集成其他重平衡技术,从而实现进一步性能提升。
  • 该方法在无需复杂损失函数、重加权或网络结构修改的情况下实现卓越性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。