Skip to main content
QUICK REVIEW

[论文解读] G-SMOTE: A GMM-based synthetic minority oversampling technique for imbalanced learning

Tianlun Zhang, Xi Yang|arXiv (Cornell University)|Oct 24, 2018
Imbalanced Data Classification Techniques被引用 7
一句话总结

G-SMOTE 提出了一种基于高斯混合模型(GMM)的合成少数类过采样技术,通过在高维空间中生成更真实的合成少数类样本,利用高斯混合模型过滤异常值和噪声合成的多数类实例,并自适应地优化超参数,从而提升不平衡学习的性能。该方法在多个数据集上实现了优越的分类性能,尤其在缺陷分派和医学诊断任务中表现突出。

ABSTRACT

Imbalanced Learning is an important learning algorithm for the classification models, which have enjoyed much popularity on many applications. Typically, imbalanced learning algorithms can be partitioned into two types, i.e., data level approaches and algorithm level approaches. In this paper, the focus is to develop a robust synthetic minority oversampling technique which falls the umbrella of data level approaches. On one hand, we proposed a method to generate synthetic samples in a high dimensional feature space, instead of a linear sampling space. On the other hand, in the proposed imbalanced learning framework, Gaussian Mixture Model is employed to distinguish the outliers from minority class instances and filter out the synthetic majority class instances. Last and more importantly, an adaptive optimization method is proposed to optimize these parameters in sampling process. By doing so, an effectiveness and efficiency imbalanced learning framework is developed.

研究动机与目标

  • 通过用更具灵活性且基于分布感知的采样方法替代传统 SMOTE 在高维特征空间中的线性插值,解决其局限性。
  • 通过高斯混合模型(GMM)区分并过滤异常值和合成的多数类实例,提升合成少数类样本的质量。
  • 开发一种自适应优化框架,自动调整采样参数,减少对启发式经验法则的依赖。
  • 通过生成更具代表性与鲁棒性的合成少数类实例,提升不平衡数据集上的分类性能。
  • 在包括医学诊断和软件缺陷分派系统在内的多样化真实世界数据集上,验证所提方法的有效性。

提出的方法

  • 在特征空间中用基于少数类实例潜在分布的非线性采样策略替代 SMOTE 的线性插值,以提升在高维空间中的泛化能力。
  • 应用高斯混合模型(GMM)对少数类实例的密度进行建模,在合成采样过程中识别并排除异常值。
  • 利用 GMM 检测并移除与多数类相似的合成实例,从而降低引入噪声或误导性样本的风险。
  • 引入一种自适应优化方法,将采样参数(如邻居数量、GMM 组件数)视为可优化变量,基于训练过程中的模型性能进行调整。
  • 将基于 GMM 的过滤机制与自适应优化方法整合到统一框架中,同时提升合成样本的质量与多样性。
  • 在应用 G-SMOTE 框架前,对文本型缺陷报告进行 TF-IDF 向量化,将非结构化数据转换为数值特征。

实验结果

研究问题

  • RQ1与线性 SMOTE 相比,基于 GMM 的方法是否能显著提升高维特征空间中合成少数类样本的质量?
  • RQ2GMM 在少数类过采样过程中,能否有效识别并过滤异常值及合成的多数类实例?
  • RQ3自适应参数优化是否能带来优于固定参数或启发式参数设置的分类性能?
  • RQ4G-SMOTE 在多样化的真实世界数据集上表现如何,特别是在软件缺陷分派和医学诊断等复杂高维领域?
  • RQ5所提方法是否能在减少少数类表示中的过拟合与噪声的同时,保持或提升 F-measure 与准确率?

主要发现

  • 在 CVFTM 数据集上,G-SMOTE 显著提升了 F-measure 与准确率,数据增强后达到 100.0% 的 F-measure 和 99.9537% 的准确率,优于基线方法。
  • 在缺陷分派数据集(Eclipse CDT_cdt-core)上,该方法将 F-measure 从 71.554 提升至 76.004,准确率从 79.941% 提升至 81.416%(使用增强数据)。
  • 在 Mozilla Core_Printing 数据集上,F-measure 从 81.586% 提升至 81.586%(数值不变),但准确率从 86.642% 提升至 86.642%,表明性能稳定,其他指标持续提升。
  • 在 GNOME Evolution_Contacts 数据集上,采用数据增强后,准确率达到 77.113%,F-measure 达到 75.103%,相较于非增强基线模型表现一致提升。
  • 自适应优化框架降低了对人工调参的依赖,使结果在多样化数据集上更具鲁棒性与泛化能力。
  • GMM 过滤机制有效减少了噪声合成样本的数量,尤其在高维稀疏数据场景(如文本缺陷报告)中效果显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。