Skip to main content
QUICK REVIEW

[论文解读] Survey of Imbalanced Data Methodologies

Lian Yu, Nengfeng Zhou|arXiv (Cornell University)|Apr 6, 2021
Imbalanced Data Classification Techniques参考文献 15被引用 16
一句话总结

本文评估了在15个UCI/Keel数据集上,针对八种机器学习算法的类别不平衡处理方法——特别是欠采样和过采样技术。研究发现,类别不平衡处理方法对逻辑回归和线性SVM等简单线性模型的性能提升最为显著;而复杂集成模型(如随机森林、XGBoost)即使不使用不平衡处理技术,也能实现较高的AUC和F-score,因此在模型可解释性非关键时更为优选。

ABSTRACT

Imbalanced data set is a problem often found and well-studied in financial industry. In this paper, we reviewed and compared some popular methodologies handling data imbalance. We then applied the under-sampling/over-sampling methodologies to several modeling algorithms on UCI and Keel data sets. The performance was analyzed for class-imbalance methods, modeling algorithms and grid search criteria comparison.

研究动机与目标

  • 评估常见数据级不平衡缓解技术在多种机器学习算法上的有效性。
  • 评估不同建模算法与类别不平衡方法在AUC和F-score方面的交互影响。
  • 比较网格搜索准则(AUC、F-score、准确率)对不平衡数据超参数调优的影响。
  • 确定特定不平衡方法(如SMOTE、Near Miss、RUSBoost)是否在不同数据集和算法上始终优于其他方法。
  • 基于性能与可解释性之间的权衡,为选择不平衡处理方法与建模算法提供实用指导。

提出的方法

  • 本研究在来自UCI和Keel的15个真实世界数据集上应用了四种不平衡处理方法——SMOTE、RUSBoost、Easy Ensemble和Near Miss,其类别不平衡比率差异显著。
  • 评估了八种建模算法:逻辑回归、线性SVM、决策树(CART)、K近邻、随机森林、XGBoost、RUSBoost和Easy Ensemble。
  • 性能通过AUC和F-score进行衡量,超参数通过以AUC、F-score和准确率为准则的网格搜索进行调优。
  • 评估包括SMOTE(合成过采样)、RUS(随机欠采样)以及基于集成的方法(如Easy Ensemble和RUSBoost)在内的数据预处理技术。
  • 分析比较了不同不平衡处理方法与算法组合在AUC和F-score上的模型性能,重点关注其一致性和提升程度。
  • 研究采用受控实验设置,固定数据划分并使用标准化评估指标,以确保方法与算法之间比较的可靠性。

实验结果

研究问题

  • RQ1类别不平衡处理方法是否在不同机器学习算法上一致地提升模型性能?
  • RQ2哪些建模算法最受益于SMOTE或RUS等数据级不平衡缓解技术?
  • RQ3不同的网格搜索准则(AUC、F-score、准确率)如何影响不平衡数据上的超参数调优与最终模型性能?
  • RQ4不同不平衡处理方法之间是否存在显著性能差异(如SMOTE vs. Near Miss vs. RUSBoost)?
  • RQ5复杂集成模型(如随机森林或XGBoost)是否能在不应用任何不平衡处理技术的情况下,在不平衡数据上实现高性能?

主要发现

  • 类别不平衡处理方法显著提升了逻辑回归和线性SVM等简单线性模型的AUC,但对复杂集成模型的提升微乎其微。
  • 随机森林和XGBoost等集成模型即使在原始不平衡数据上也能实现较高的AUC和F-score,表明其对类别不平衡具有鲁棒性,无需额外预处理。
  • 在F-score方面,集成算法优于专门针对不平衡问题的算法及简单模型,尽管AUC值相近,但对RUSBoost和Easy Ensemble仍略有优势。
  • 对于复杂模型,网格搜索准则(AUC、F-score、准确率)对最终性能影响较小,但对K近邻和CART等简单模型影响更大。
  • 尚无充分证据表明某一种不平衡处理方法显著优于其他方法——SMOTE、RUSBoost、Easy Ensemble和Near Miss在不同数据集和算法上表现相似。
  • 对K近邻和CART等简单非线性模型应用不平衡处理方法常导致过拟合,且性能提升不一致,尤其在以F-score为调优目标时更为明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。