Skip to main content
QUICK REVIEW

[论文解读] Efficient Hybrid Oversampling and Intelligent Undersampling for Imbalanced Big Data Classification

Carla Vairetti, José Luis Assadi|arXiv (Cornell University)|Oct 9, 2023
Imbalanced Data Classification TechniquesComputer Science被引用 3
一句话总结

该论文提出SMOTENN,一种新颖的混合重采样方法,通过在单个MapReduce遍历中结合智能欠采样(ENN)与过采样(SMOTE),显著提升了不平衡大数据的效率与性能。与独立执行SMOTE和ENN相比,运行时间最高可减少72.9%;在小型、中型和大型数据集上,g-mean表现优于基线方法,同时有效减少了边界区域的噪声。

ABSTRACT

Imbalanced classification is a well-known challenge faced by many real-world applications. This issue occurs when the distribution of the target variable is skewed, leading to a prediction bias toward the majority class. With the arrival of the Big Data era, there is a pressing need for efficient solutions to solve this problem. In this work, we present a novel resampling method called SMOTENN that combines intelligent undersampling and oversampling using a MapReduce framework. Both procedures are performed on the same pass over the data, conferring efficiency to the technique. The SMOTENN method is complemented with an efficient implementation of the neighborhoods related to the minority samples. Our experimental results show the virtues of this approach, outperforming alternative resampling techniques for small- and medium-sized datasets while achieving positive results on large datasets with reduced running times.

研究动机与目标

  • 为解决大规模机器学习数据集中类别不平衡的问题,传统重采样方法在计算上变得不可行。
  • 通过提出首个在大数据环境中结合SMOTE与ENN的单次遍历混合欠采样-过采样方法,弥合文献中的空白。
  • 通过在可扩展的MapReduce框架中联合执行邻域计算、合成样本生成与多数类样本移除,提升计算效率。
  • 通过实证评估在大数据环境下过采样与欠采样的权衡,特别是运行时间与模型性能之间的关系。
  • 提供一种鲁棒且可默认配置的方法,在无需大量超参数调优的情况下,保持在不同数据集大小与不平衡比率下的高性能。

提出的方法

  • SMOTENN为每个少数类样本定义单一的k-邻域,实现在一次数据遍历中同时应用ENN与SMOTE。
  • 对于每个少数类样本,方法识别其k个最近邻,并通过移除邻域中被多数类样本数量超过的样本,应用ENN。
  • 同时,通过在少数类样本与其k个最近邻之间使用线性插值,利用SMOTE的标准插值公式生成合成少数类样本。
  • 整个过程通过MapReduce框架并行化,距离计算通过可扩展的分布式距离函数进行优化。
  • 通过在SMOTENN处理前引入随机欠采样(RUS)作为预处理步骤,进一步提升方法性能,以减少数据量。
  • 实现基于Amazon EC2上的Spark 2.4.8,使用m5.xlarge与c5.5xlarge实例,确保对大规模数据集的高可扩展性。

实验结果

研究问题

  • RQ1能否设计一种结合智能欠采样与过采样的混合重采样方法,使其在大数据环境中以单次遍历高效运行?
  • RQ2SMOTENN的计算效率与独立执行SMOTE和ENN相比如何,特别是在数据集规模增大时?
  • RQ3所提出的混合方法在不平衡大数据上的分类性能(以g-mean衡量)是否优于单独使用SMOTE、ENN、RUS或其组合?
  • RQ4SMOTENN相较于其他重采样技术,在减少边界区域噪声方面有多大程度的改善?
  • RQ5是否存在一种SMOTENN的默认配置,可在无需大量超参数调优的情况下,对多样化数据集保持一致的高性能?

主要发现

  • SMOTENN的平均运行时间仅为独立执行SMOTE与ENN总时间的38.8%,最佳情况下效率达20.4%,最差情况下为72.9%。
  • 在最大数据集(lds5)上,SMOTENN耗时551.8秒,比单独使用ENN(339.3秒)快17倍,且显著快于SMOTE+ENN组合(757.1秒)。
  • 在小型与中型数据集上,SMOTENN在g-mean指标上优于所有基线方法,表现出更优的分类性能。
  • 该方法在不同不平衡比率与特征数量下均保持稳健性能,无需大量超参数调优。
  • 尽管效率高,RUS仍是最快的方法(所有数据集上均少于4秒),凸显了速度与噪声减少之间的权衡。
  • 结果表明,虽然合成过采样在较小数据集中有益,但在极大规模数据集(如数百万样本)中,其价值减弱,此时RUS可能已足够。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。