[论文解读] Imbalanced Class Data Performance Evaluation and Improvement using Novel Generative Adversarial Network-based Approach: SSG and GBO
本文提出了两种新颖的基于生成对抗网络(GAN)的过采样技术——基于GAN的过采样(GBO)和SVM-SMOTE-GAN(SSG),以解决机器学习中的类别不平衡问题。通过结合生成对抗网络与SVM引导的SMOTE方法,这些方法生成的少数类合成样本具有更优的高斯分布特性并减少了误分类现象,在八个基准数据集上的准确率、F1分数和误分类率方面均优于传统SMOTE方法。
Class imbalance in a dataset is one of the major challenges that can significantly impact the performance of machine learning models resulting in biased predictions. Numerous techniques have been proposed to address class imbalanced problems, including, but not limited to, Oversampling, Undersampling, and cost-sensitive approaches. Due to its ability to generate synthetic data, oversampling techniques such as the Synthetic Minority Oversampling Technique (SMOTE) is among the most widely used methodology by researchers. However, one of SMOTE's potential disadvantages is that newly created minor samples may overlap with major samples. As an effect, the probability of ML models' biased performance towards major classes increases. Recently, generative adversarial network (GAN) has garnered much attention due to its ability to create almost real samples. However, GAN is hard to train even though it has much potential. This study proposes two novel techniques: GAN-based Oversampling (GBO) and Support Vector Machine-SMOTE-GAN (SSG) to overcome the limitations of the existing oversampling approaches. The preliminary computational result shows that SSG and GBO performed better on the expanded imbalanced eight benchmark datasets than the original SMOTE. The study also revealed that the minor sample generated by SSG demonstrates Gaussian distributions, which is often difficult to achieve using original SMOTE.
研究动机与目标
- 解决传统SMOTE的局限性,例如合成样本重叠以及在高维数据中泛化能力差的问题。
- 利用生成对抗网络(GAN)改善少数类样本的表示,生成更具真实感的合成样本。
- 通过生成具有更优类别分布特性的合成少数类样本,减少模型对多数类的偏见。
- 在医疗诊断和欺诈检测等实际应用场景中提升分类性能,因为少数类误分类的后果极为严重。
- 在标准的类别不平衡基准数据集上,评估并比较所提出方法(GBO和SSG)与SMOTE及基线模型的表现。
提出的方法
- 提出基于GAN的过采样(GBO),一种利用生成器训练以欺骗判别器的GAN框架,从而提升数据的真实性。
- 提出SVM-SMOTE-GAN(SSG),一种结合SMOTE与SVM边界检测及GAN生成的混合方法,以生成更鲁棒且重叠更少的合成少数类样本。
- 采用条件GAN架构,其中生成器学习基于类别特定特征和SVM推导出的决策边界来生成少数类样本。
- 采用两阶段训练流程:首先,SVM识别决策边界附近的临界少数类样本;其次,GAN在这些点周围生成新样本,以提升泛化能力。
- 通过对抗损失和特征重建损失联合优化生成器与判别器,以确保生成样本保留原始类别分布和类间距离特性。
- 在所有数据集上固定超参数,以确保与SMOTE及基线模型的公平比较,尽管建议针对各数据集进行参数调优。
实验结果
研究问题
- RQ1在高度不平衡的数据集中,基于GAN的方法是否能相比传统SMOTE减少少数类样本的误分类?
- RQ2将SVM与SMOTE及GAN结合(即SSG)是否能通过减少与多数类样本的重叠,提升合成少数类样本的质量?
- RQ3所提出方法(GBO和SSG)在多大程度上保留了原始数据的类间距离与高斯分布特性?
- RQ4在多个基准数据集上,GBO和SSG在准确率、精确率、召回率和F1分数方面与SMOTE相比表现如何?
- RQ5所提出方法是否能在无需大量超参数调优的情况下,推广至多样且高维的不平衡数据集?
主要发现
- 在全部八个基准数据集上,SSG和GBO显著降低了总误分类率(假正例 + 假负例),优于SMOTE和原始数据。
- 在Abalone数据集中,SSG生成的样本分布比SMOTE生成的样本更接近高斯分布,经直方图分析得到验证。
- 在Abalone数据集中,SSG实现了最低的误分类率(80),而原始数据和SMOTE的误分类率均为122。
- 在Shuttle数据集中,SSG将误分类率从原始数据的39和SMOTE的20降低至11,显示出在高维数据中的优越性能。
- 在Pageblocks数据集中,SSG实现了最低的误分类率(1)和最高的F1分数,优于SMOTE和GBO。
- 标准差分析表明,SSG在Ecoli、Winequality、Abalone、Ionosphere和Shuttle数据集中,最接近原始数据的类间距离,表明其具有更优的数据分布保真度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。