[论文解读] The Effect of Balancing Methods on Model Behavior in Imbalanced Classification Problems
本文提出一种框架,不仅通过性能评估不平衡分类中的平衡方法,还通过可解释人工智能(XAI)工具分析其对模型行为的影响。该框架引入了性能增益图和一种新度量指标(ASDD),用于比较部分依赖和累积局部效应轮廓的变化,揭示了尽管性能有所提升,但Near Miss等方法在树模型中显著改变了模型行为。
Imbalanced data poses a significant challenge in classification as model performance is affected by insufficient learning from minority classes. Balancing methods are often used to address this problem. However, such techniques can lead to problems such as overfitting or loss of information. This study addresses a more challenging aspect of balancing methods - their impact on model behavior. To capture these changes, Explainable Artificial Intelligence tools are used to compare models trained on datasets before and after balancing. In addition to the variable importance method, this study uses the partial dependence profile and accumulated local effects techniques. Real and simulated datasets are tested, and an open-source Python package edgaro is developed to facilitate this analysis. The results obtained show significant changes in model behavior due to balancing methods, which can lead to biased models toward a balanced distribution. These findings confirm that balancing analysis should go beyond model performance comparisons to achieve higher reliability of machine learning models. Therefore, we propose a new method performance gain plot for informed data balancing strategy to make an optimal selection of balancing method by analyzing the measure of change in model behavior versus performance gain.
研究动机与目标
- 探究数据平衡方法在性能指标之外如何改变模型行为。
- 弥补对平衡技术如何影响模型可解释性和决策过程的理解空白。
- 开发一种系统化方法,用于选择在性能增益与最小行为扰动之间取得平衡的平衡技术。
- 构建基准数据集并建立统一工作流,用于评估平衡方法和XAI工具。
- 提供一种透明、可复现的框架,用于评估模型性能与行为变化之间的权衡。
提出的方法
- 使用可解释人工智能(XAI)工具——部分依赖轮廓(PDP)和累积局部效应(ALE)轮廓——分析平衡前后模型行为的变化。
- 提出一种新度量指标SDD(依赖性差异的标准化值),用于量化不同特征上模型行为的变化。
- 采用性能增益图,可视化预测性能(平衡准确率)与模型行为变化(ASDD值)之间的权衡。
- 开发开源Python包'edgaro',统一数据平衡、模型训练与XAI分析的工作流。
- 在具有已知真实情况的模拟数据集和真实世界不平衡数据集上进行实验,以验证研究发现。
- 使用FDR校正的Wilcoxon符号秩检验评估观察到的模型行为与性能变化的统计显著性。
实验结果
研究问题
- RQ1不同数据平衡方法如何通过部分依赖和累积局部效应轮廓的变化,改变机器学习模型的行为?
- RQ2像Near Miss或随机欠采样这样的平衡技术在多大程度上扭曲了特征与预测之间学习到的关系?
- RQ3统一度量指标(ASDD)能否有效量化由数据平衡引起的行为变化程度?
- RQ4不同算法(如逻辑回归、随机森林、XGBoost)中,平衡方法的性能增益与模型行为变化之间是否存在相关性?
- RQ5性能增益图能否作为决策工具,用于选择在性能与行为稳定性之间实现最优平衡的平衡方法?
主要发现
- 在模拟数据集和真实数据集上,随机欠采样在平衡准确率方面始终带来最高的性能增益。
- Near Miss方法在随机森林和XGBoost模型中引起最大的模型行为变化,这一结果通过ASDD值得以衡量。
- 逻辑回归模型的ASDD值较低(行为变化较小),但与树模型相比,其特征依赖轮廓仍表现出显著变化。
- 性能增益图显示,性能增益高的方法(如随机欠采样)通常伴随着显著的行为变化,尤其在高不平衡场景下更为明显。
- 数据平衡对模型行为的影响随原始数据分布中更高的方差和不平衡比率而增强。
- 性能增益图能有效可视化权衡关系,表明尽管Near Miss的性能提升中等,但在行为变化方面风险更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。