Skip to main content
QUICK REVIEW

[论文解读] Clustering and Learning from Imbalanced Data

Naman Deep Singh, Abhinav Dhall|ArXiv.org|Nov 2, 2018
Imbalanced Data Classification Techniques参考文献 26被引用 21
一句话总结

本文提出了一种新型的数据级重采样方法——聚类增强型过采样(Clustering-Based Oversampling, CBOS),该方法基于聚类中心和样本间距离生成合成的少数类样本,有效减少过拟合并保持多数类的分布。CBOS 在深度神经网络分类器上,于多种指标下均优于 SMOTE、ADASYN 和 SMOTE-ENN,尤其在高维数据中表现更优,归因于其具备分布感知且非侵入性的过采样策略。

ABSTRACT

A learning classifier must outperform a trivial solution, in case of imbalanced data, this condition usually does not hold true. To overcome this problem, we propose a novel data level resampling method - Clustering Based Oversampling for improved learning from class imbalanced datasets. The essential idea behind the proposed method is to use the distance between a minority class sample and its respective cluster centroid to infer the number of new sample points to be generated for that minority class sample. The proposed algorithm has very less dependence on the technique used for finding cluster centroids and does not effect the majority class learning in any way. It also improves learning from imbalanced data by incorporating the distribution structure of minority class samples in generation of new data samples. The newly generated minority class data is handled in a way as to prevent outlier production and overfitting. Implementation analysis on different datasets using deep neural networks as the learning classifier shows the effectiveness of this method as compared to other synthetic data resampling techniques across several evaluation metrics.

研究动机与目标

  • 解决现有合成过采样技术(如 SMOTE 和 ADASYN)的局限性,这些方法常引入噪声、导致过拟合或干扰多数类分布。
  • 提升在类别不平衡二分类数据集上的学习性能,特别是在高维或极端类别不平衡场景下。
  • 开发一种对维度不敏感且不改变多数类数据底层结构的重采样方法。
  • 在生成合成样本时融入少数类样本的内在分布结构,以增强泛化能力并减少异常值的产生。
  • 通过使用深度神经网络作为学习分类器,在多个评估指标上验证所提方法的优越性能。

提出的方法

  • 使用聚类(如 k-means)识别少数类样本的聚类中心,作为生成合成样本的基础。
  • 计算每个少数类样本到其聚类中心的距离,以确定为该样本生成多少个合成样本。
  • 对距离进行归一化,使更接近聚类中心的样本获得更高的生成数量,突出代表性样本。
  • 通过使用有界随机函数对少数类样本进行扰动来生成新的合成样本,确保新点保持在合理的数据边界内。
  • 采用距离归一化技术控制每个少数类实例生成的合成样本数量,降低过拟合和异常值风险。
  • 在过采样过程中不与多数类数据交互,以保持其原始分布,避免对数据空间造成非预期干扰。

实验结果

研究问题

  • RQ1基于聚类的过采样方法是否能在不损害多数类表示的前提下提升不平衡数据集的分类性能?
  • RQ2在不同类别不平衡水平下,CBOS 与 SMOTE、ADASYN 和 SMOTE-ENN 在 F1 分数、AUC 和召回率等关键指标上的表现如何比较?
  • RQ3所提方法在高维数据中是否保持鲁棒性和泛化能力,而传统方法如 SMOTE 在此类场景下常表现不佳?
  • RQ4与现有合成采样技术相比,CBOS 在多大程度上减少了过拟合和异常值的生成?
  • RQ5该方法是否可推广至其他聚类算法和学习模型,而不仅限于 k-means 和深度神经网络?

主要发现

  • CBOS 在低维和高维数据集上,于多个评估指标(F1、AUC、召回率)上显著优于 SMOTE、ADASYN 和 SMOTE-ENN。
  • 在严重不平衡的数据集(如 Data-4)上,CBOS 保持了稳定的性能,而其他方法的召回率和 F1 分数,尤其是少数类,明显下降。
  • CBOS 未对多数类分类产生负面影响,其多数类的召回率在各数据集上保持稳定或有所提升,而其他方法则存在此类问题。
  • 在高维设置下(如 Data-5,具有高属性与样本比),CBOS 的性能与 SMOTE 和 ADASYN 相当,而传统方法性能下降,表明其具有更优的可扩展性。
  • 通过使用距离归一化的、基于中心的采样方法并结合有界随机扰动,该方法有效防止了过拟合和异常值的生成。
  • CBOS 对聚类算法的选择具有鲁棒性,若使用均值漂移或高斯混合模型等替代模型,预期也能获得相当的性能表现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。