[论文解读] The Random Forest Classifier in WEKA: Discussion and New Developments for Imbalanced Data
本文提出了一种针对WEKA数据挖掘工具包的平衡随机森林(BRF)分类器扩展,以解决医学和现实世界数据集中的类别不平衡问题。通过修改自助采样方法,使每棵树中少数类和多数类的实例数量相等,BRF在不降低整体准确率的前提下提升了少数类的预测性能,在交叉验证中优于标准随机森林和加权随机森林在不平衡医学数据集上的表现。
Data analysis and machine learning have become an integrative part of the modern scientific methodology, providing automated techniques to predict further information based on observations. One of these classification and regression techniques is the random forest approach. Those decision tree based predictors are best known for their good computational performance and scalability. However, in case of severely imbalanced training data, as often seen in medical studies' data with large control groups, the training algorithm or the sampling process has to be altered in order to improve the prediction quality for minority classes. In this work, a balanced random forest approach for WEKA is proposed. Furthermore, the prediction quality of the unmodified random forest implementation and the new balanced random forest version for WEKA are evaluated against reference implementations in R. Two-class problems on balanced data sets and imbalanced medical studies' data are investigated. A superior prediction quality using the proposed method for imbalanced data is shown compared to the other three techniques.
研究动机与目标
- 解决标准随机森林分类器在少数类被低估的不平衡医学数据集上表现不佳的问题。
- 扩展WEKA框架,引入一种平衡随机森林(BRF)分类器,通过修改自助采样方法,确保每棵树的训练集中少数类和多数类得到均衡表示。
- 在不平衡和平衡数据集上,评估BRF与标准RF、加权RF以及基于R的BRF实现的性能表现。
- 证明BRF在保持高整体准确率的同时,显著提升严重不平衡数据中少数类的真正率(TPR)。
- 为WEKA提供一种实用的开源扩展,支持在医疗诊断等现实应用中实现更公平的分类。
提出的方法
- BRF分类器通过将每类的样本大小设定为少数类的大小,修改了标准随机森林的自助采样过程,确保每棵树的训练集中各类实例数量均衡。
- 对于每棵树,采用有放回的自助采样,但每类的实例数量被限制在少数类的大小,从而防止多数类的过度表示。
- 树的构建过程使用信息增益进行分裂,并生成未剪枝的决策树,最终预测基于所有树的多数投票结果。
- 该实现通过继承现有的随机森林类,集成到WEKA 3.7.12中,新增一个参数以控制类别平衡的自助采样。
- 通过10折交叉验证评估性能,测试不同树的数量(20、100、2000),测量多数类和少数类的TPR、CCR和平均TPR。
- 将结果与标准RF、加权RF以及基于R的BRF实现进行比较,以验证所提方法的一致性和优越性。
实验结果
研究问题
- RQ1与WEKA中的标准随机森林相比,平衡随机森林分类器是否能提升在不平衡医学数据集上对少数类的预测性能?
- RQ2WEKA中提出的BRF实现与R中的参考实现及其他RF变体相比,性能如何?
- RQ3在树训练过程中对自助采样进行平衡,能在多大程度上减少对多数类的偏差?
- RQ4BRF是否在保持高整体准确率的同时,显著提升少数类的真正率(TPR)?
- RQ5所提出的BRF扩展能否有效集成到WEKA框架中,以支持临床和现实应用中更公平的机器学习?
主要发现
- 在HY1数据集上,BRF-W变体在100棵树时达到95.4%的少数类TPR,2000棵树时仍为95.4%,显著优于标准RF(88.1%和86.6%)以及BRF-R(92.6%和91.7%)。
- 在HY2数据集上,BRF-W在100棵树时达到97.0%的少数类TPR,2000棵树时为97.1%,优于RF-W(88.3%和88.7%)和RF-R(86.9%和88.1%)。
- 在ESS数据集上,BRF-W在100和2000棵树时分别达到93.5%和93.9%的少数类TPR,优于RF-W(90.4%和89.4%)和RF-R(86.8%和87.8%)。
- 在平衡数据集(SPAM、EG)上,BRF-W保持了高性能,平均TPR分别为94.8%和99.3%,表明在平衡数据上无性能退化。
- 在所有不平衡数据集上,BRF-W的平均TPR(TPR_avg)始终高于其他方法,分别达到HY1的96.4%、HY2的97.7%和ESS的95.4%。
- 所提出的WEKA中的BRF在少数类预测上表现出优越性能,同时保持或略微降低整体准确率,证实了其在处理不平衡数据上的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。