[论文解读] Banzhaf Random Forests
本文提出了一种新型随机森林算法——Banzhaf随机森林(BRF),该算法基于合作博弈论中的Banzhaf权力指数,通过衡量特征之间的联盟依赖关系来评估特征重要性,确保理论一致性。实验结果表明,BRF在性能上优于当前最先进的分类器,且在计算效率上显著优于以往的理论一致型随机森林。
Random forests are a type of ensemble method which makes predictions by combining the results of several independent trees. However, the theory of random forests has long been outpaced by their application. In this paper, we propose a novel random forests algorithm based on cooperative game theory. Banzhaf power index is employed to evaluate the power of each feature by traversing possible feature coalitions. Unlike the previously used information gain rate of information theory, which simply chooses the most informative feature, the Banzhaf power index can be considered as a metric of the importance of each feature on the dependency among a group of features. More importantly, we have proved the consistency of the proposed algorithm, named Banzhaf random forests (BRF). This theoretical analysis takes a step towards narrowing the gap between the theory and practice of random forests for classification problems. Experiments on several UCI benchmark data sets show that BRF is competitive with state-of-the-art classifiers and dramatically outperforms previous consistent random forests. Particularly, it is much more efficient than previous consistent random forests.
研究动机与目标
- 弥合随机森林在理论理解与实际应用之间的长期差距。
- 开发一种适用于批量多分类任务的理论一致型随机森林模型,而此前的理论模型未能实现这一目标。
- 引入一种基于合作博弈论的新特征重要性度量方法,以捕捉特征之间的相互依赖关系。
- 在保持或提升预测性能的同时,相比现有理论一致型随机森林,提升计算效率。
提出的方法
- 应用Banzhaf权力指数评估每个特征对所有可能特征联盟的贡献。
- 将Banzhaf指数作为传统信息增益的替代方法,用于树构建过程,以基于集体依赖性优先选择特征。
- 利用Banzhaf权力指数指导决策树的分裂选择,确保特征选择过程更具鲁棒性且理论基础更坚实。
- 通过自助采样和随机特征选择的方式引入随机性,如同标准随机森林一样,以保持多样性。
- 在标准假设下证明BRF的一致性,表明随着数据集规模增大,其收敛于最优贝叶斯分类器。
- 通过基于节点误分类率的终止条件实现算法实现,确保树结构的稳定增长。
实验结果
研究问题
- RQ1合作博弈论能否被有效应用于随机森林,以提升理论一致性?
- RQ2使用Banzhaf权力指数进行特征选择是否能比基于传统信息增益的方法获得更好的分类性能?
- RQ3与当前最先进的随机森林及一致型模型相比,所提出的BRF模型在准确率和效率方面表现如何?
- RQ4基于Banzhaf的特征重要性机制是否比独立特征选择更能有效捕捉特征依赖关系?
主要发现
- 在多个UCI数据集上,BRF的分类准确率与KNN、SVM以及Breiman原始随机森林模型相当。
- 在大豆数据集上,BRF实现了100%的准确率,与表现最佳的模型持平。
- 在航天飞机数据集上,BRF达到99.57%的准确率,与Breiman的模型持平,且优于Biau的一致型模型(82.56%)。
- BRF显著优于Biau的一致型随机森林模型,后者在大肠杆菌数据集上仅达到42.86%的准确率。
- BRF在效率上优于Biau的一致型模型,其在航天飞机数据集上的训练时间仅为80.66秒,而Biau模型耗时39,600.63秒。
- 该模型对树的数量具有鲁棒性,最优性能出现在100棵树时,且在不同树数量下均能保持高准确率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。