[论文解读] Bayesian and empirical Bayesian forests
本文提出了贝叶斯森林(BF)与经验贝叶斯森林(EBF),将随机森林建模为非参数贝叶斯模型的后验抽样,以提升可解释性与稳定性。EBF通过先拟合一个浅层CART主干,再在各分支上并行拟合森林,实现了对大规模数据的高效扩展,在预测性能上仅比完整贝叶斯森林低2%,同时在误差率上比子采样方法最高提升38%。
We derive ensembles of decision trees through a nonparametric Bayesian model, allowing us to view random forests as samples from a posterior distribution. This insight provides large gains in interpretability, and motivates a class of Bayesian forest (BF) algorithms that yield small but reliable performance gains. Based on the BF framework, we are able to show that high-level tree hierarchy is stable in large samples. This leads to an empirical Bayesian forest (EBF) algorithm for building approximate BFs on massive distributed datasets and we show that EBFs outperform sub-sampling based alternatives by a large margin.
研究动机与目标
- 开发一种贝叶斯非参数框架,通过在树结构上进行后验抽样,以理解并改进随机森林。
- 分析在大样本下,从非参数贝叶斯DGP中重复抽样时CART树的稳定性。
- 设计一种高效、可扩展的算法——经验贝叶斯森林(EBF),用于在大规模分布式数据集上构建近似贝叶斯森林。
- 证明EBF在多个真实世界数据集上的预测准确性显著优于基于子采样的分布式森林方法。
- 通过集中计算资源于模型中最关键部分,实现在大数据环境中可靠、高性能的树集成学习。
提出的方法
- 使用在有限支撑上的狄利克雷-多项式先验,形式化数据生成过程(DGP)的非参数贝叶斯模型,从而实现对树结构的后验抽样。
- 推导出贝叶斯森林(BF)算法,从DGP的后部分布中抽样CART树,将随机森林视为一种频率学派近似。
- 建立树稳定性的理论边界:后验DGP实现与样本CART分裂匹配的概率 ≳ 1 − (p / √n) e^−n,表明在大样本下具有高度的顶层稳定性。
- 提出经验贝叶斯森林(EBF),将树主干结构固定为后验众数(通过在全数据上拟合一次CART),然后在每个分支上独立抽样森林。
- 利用分布式计算框架(如Apache Spark)在各分支上并行拟合EBF,最大限度减少通信开销,提升可扩展性。
- 使用最小叶节点大小和主干深度作为调参超参数,以平衡计算成本与预测性能。
实验结果
研究问题
- RQ1随机森林能否被解释为数据生成过程的非参数贝叶斯模型的近似后验样本?
- RQ2在大样本下,CART树在不同DGP实现中的稳定性如何,尤其是顶层结构?
- RQ3两阶段方法——先拟合单个主干,再在各分支上独立拟合森林——是否能在大规模数据上实现接近完整贝叶斯森林的预测性能?
- RQ4在预测准确性和可扩展性方面,EBF与基于子采样的分布式森林方法相比表现如何?
- RQ5在EBF中,主干深度、分支大小与预测误差之间的权衡关系是什么?
主要发现
- 在加州住房数据集上,EBF的预测性能仅比完整贝叶斯森林低2%,而子采样森林(SSFs)则差10%。
- 在葡萄酒质量数据集上,EBF仅比完整BF差1%(均方根误差),而SSFs则差12%。
- 在啤酒品牌选择预测任务中,EBF比BF差4.4%,但SSFs的误分类率高出38%。
- EBF在不同最小叶节点大小下表现稳健,当叶节点大小减半时,误差最多增加7.6%;而决策树的误差则增加29.5%。
- 在eBay上,EBF在1200万条交易记录上将误分类误差比SSF方法降低了1.3%,成功识别出超过20,000起额外的不良买家体验。
- 理论分析证实,在大样本下顶层树结构具有高度稳定性,分裂匹配概率 ≳ 1 − (p / √n) e^−n,为EBF方法提供了理论依据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。