Skip to main content
QUICK REVIEW

[论文解读] Effective Class-Imbalance learning based on SMOTE and Convolutional Neural Networks

Javad Hasannataj Joloudari, Abdolreza Marefat|arXiv (Cornell University)|Sep 1, 2022
Imbalanced Data Classification Techniques被引用 8
一句话总结

本文提出了一种混合深度学习方法,结合SMOTE过采样与卷积神经网络(CNNs),以解决二分类中的类别不平衡问题。通过将SMOTE与归一化及CNN训练相结合,该方法在24个类别不平衡的数据集上实现了99.08%的准确率,显著优于基线技术。

ABSTRACT

Imbalanced Data (ID) is a problem that deters Machine Learning (ML) models for achieving satisfactory results. ID is the occurrence of a situation where the quantity of the samples belonging to one class outnumbers that of the other by a wide margin, making such models learning process biased towards the majority class. In recent years, to address this issue, several solutions have been put forward, which opt for either synthetically generating new data for the minority class or reducing the number of majority classes for balancing the data. Hence, in this paper, we investigate the effectiveness of methods based on Deep Neural Networks (DNNs) and Convolutional Neural Networks (CNNs), mixed with a variety of well-known imbalanced data solutions meaning oversampling and undersampling. To evaluate our methods, we have used KEEL, breast cancer, and Z-Alizadeh Sani datasets. In order to achieve reliable results, we conducted our experiments 100 times with randomly shuffled data distributions. The classification results demonstrate that the mixed Synthetic Minority Oversampling Technique (SMOTE)-Normalization-CNN outperforms different methodologies achieving 99.08% accuracy on the 24 imbalanced datasets. Therefore, the proposed mixed model can be applied to imbalanced binary classification problems on other real datasets.

研究动机与目标

  • 解决机器学习中的类别不平衡挑战,其中少数类样本不足,模型易偏向多数类。
  • 探究将深度学习模型(特别是CNNs)与数据级技术(如SMOTE)结合处理不平衡数据的有效性。
  • 评估将过采样(SMOTE)与归一化结合并集成到CNN中的混合方法在多样化真实世界数据集上的性能表现。
  • 在多次运行和多个数据集上展示一致且高精度的结果,确保所提方法的可靠性与泛化能力。

提出的方法

  • 应用合成少数类过采样技术(SMOTE)生成少数类的合成样本,以改善数据平衡性。
  • 整合数据归一化技术以稳定并提升CNN模型的训练动态。
  • 在增强后的数据集上训练卷积神经网络(CNN),以从不平衡数据中学习鲁棒的分层特征。
  • 将SMOTE与归一化及CNN整合到统一流程中,构建一种混合方法,以增强模型的泛化能力。
  • 在所有实验中对数据分布进行100次随机打乱,以确保统计可靠性并降低结果方差。
  • 使用标准分类指标在多个基准数据集(包括KEEL、乳腺癌和Z-Alizadeh Sani)上评估性能。

实验结果

研究问题

  • RQ1SMOTE与CNNs结合在提升不平衡数据集分类准确率方面的有效性如何?
  • RQ2将归一化与SMOTE及CNNs结合是否能带来更稳定和可靠的模型性能?
  • RQ3所提出的SMOTE-归一化-CNN模型在处理多样化数据集中的类别不平衡问题时,与其他现有方法相比表现如何?
  • RQ4所提方法是否能在不同类型不平衡二分类问题中实现良好泛化?
  • RQ5对数据进行多次随机打乱对模型性能的一致性与可靠性有何影响?

主要发现

  • SMOTE-归一化-CNN模型在24个类别不平衡数据集上实现了99.08%的分类准确率,显著优于其他基线方法。
  • 所提方法表现出高度一致性和可靠性,结果基于100次随机数据打乱的平均值计算,有效降低了方差。
  • SMOTE与归一化及CNNs的整合显著改善了学习动态,并减少了对多数类的偏差。
  • 该模型在多样化的真实世界数据集(包括KEEL、乳腺癌和Z-Alizadeh Sani)上展现出强大的泛化能力。
  • 结果证实,结合数据级增强(SMOTE)与深度学习(CNNs)的混合方法在不平衡二分类任务中极为有效。
  • 该方法优于其他配置,凸显了将SMOTE与适当的预处理及深度学习架构结合的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。