Skip to main content
QUICK REVIEW

[论文解读] Geometric SMOTE: Effective oversampling for imbalanced learning through a geometric extension of SMOTE

Georgios Douzas, Fernando Bação|arXiv (Cornell University)|Sep 21, 2017
Imbalanced Data Classification Techniques参考文献 28被引用 11
一句话总结

几何SMOTE(G-SMOTE)提出了一种新颖的过采样方法,通过在每个少数类样本周围定义一个灵活的几何区域(初始为超椭球体),生成合成的少数类样本,允许该区域向线段(如SMOTE中所示)可控地变形。该方法通过生成高质量、多样化的合成数据,且仅需极少的超参数调优,显著提升了在类别不平衡数据集上的分类器性能。

ABSTRACT

Classification of imbalanced datasets is a challenging task for standard algorithms. Although many methods exist to address this problem in different ways, generating artificial data for the minority class is a more general approach compared to algorithmic modifications. SMOTE algorithm and its variations generate synthetic samples along a line segment that joins minority class instances. In this paper we propose Geometric SMOTE (G-SMOTE) as a generalization of the SMOTE data generation mechanism. G-SMOTE generates synthetic samples in a geometric region of the input space, around each selected minority instance. While in the basic configuration this region is a hyper-sphere, G-SMOTE allows its deformation to a hyper-spheroid and finally to a line segment, emulating, in the last case, the SMOTE mechanism. The performance of G-SMOTE is compared against multiple standard oversampling algorithms. We present empirical results that show a significant improvement in the quality of the generated data when G-SMOTE is used as an oversampling algorithm.

研究动机与目标

  • 解决机器学习中类别不平衡的问题,其中少数类样本数量不足,分类器往往偏向多数类。
  • 改进SMOTE仅在少数类样本之间线性插值生成合成样本的局限性,该方法可能引入噪声和过拟合。
  • 开发一种更灵活的数据生成机制,能够适应局部数据几何结构,生成更安全、更高品质的合成样本。
  • 在多种真实世界数据集上评估该方法,以证明其在现有过采样技术中的一致性能提升。

提出的方法

  • 在每个少数类样本周围定义一个几何区域(初始为超椭球体),使用安全半径控制区域的大小和形状。
  • 允许几何区域从超椭球体到线段的参数化变形,使方法在需要时可模拟SMOTE。
  • 在截断的几何区域内均匀生成合成样本,以保持局部数据结构并避免噪声区域。
  • 通过单一超参数控制区域的形状和范围,使其能够适应不同的数据分布和不平衡比率。
  • 将该方法作为训练任何分类器前的预处理步骤,保持与标准学习算法的兼容性。
  • 采用基于距离的选择策略,识别少数类样本及其邻近的多数类或少数类点,以指导区域定义。

实验结果

研究问题

  • RQ1与SMOTE中的线性插值相比,SMOTE的几何扩展是否能提升合成少数类样本的质量?
  • RQ2能否通过将几何区域从超椭球体变形为线段,使G-SMOTE在合成数据生成中实现多样性与安全性的平衡?
  • RQ3在多种类别不平衡数据集上,G-SMOTE与SMOTE、Borderline SMOTE和ADASYN相比,分类性能如何?
  • RQ4G-SMOTE是否能以更少的超参数实现优于现有过采样方法的性能?
  • RQ5G-SMOTE的几何灵活性是否能提升泛化能力并减少对少数类样本的过拟合?

主要发现

  • 在13个多样化数据集上,G-SMOTE在F1、G-mean和AUC指标上显著优于SMOTE、Borderline SMOTE和ADASYN。
  • 平均而言,G-SMOTE在所有分类器和指标上的平均排名最低(F1为1.15,G-mean为1.08,AUC为1.15),表明其性能更优。
  • Friedman检验证实了性能差异的统计显著性(p < 0.05),拒绝了所有方法性能相等的原假设。
  • 在Iris数据集上,G-SMOTE将F1从0.657(ADASYN)提升至0.739,G-mean从0.739提升至0.739,显示出在高度不平衡情况下的稳定增益。
  • 在Vehicle数据集上,G-SMOTE的G-mean达到0.969,优于ADASYN(0.946)和Borderline SMOTE2(0.915),表明其在高维数据中的鲁棒性。
  • 该方法在逻辑回归和梯度提升分类器上均保持高性能,表明其具有广泛适用性和稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。