[论文解读] XBART: Accelerated Bayesian Additive Regression Trees
XBART 提出了一种随机爬山算法,通过用快速、自适应的搜索策略替代传统的 MCMC,加速了贝叶斯加性回归树(BART)的计算,实现了与标准 BART 相当的预测精度,同时速度更快、内存占用更低。在大规模数据下,其精度优于 XGBoost、随机森林和神经网络,尤其在无需超参数调优的情况下表现更优。
Bayesian additive regression trees (BART) (Chipman et. al., 2010) is a powerful predictive model that often outperforms alternative models at out-of-sample prediction. BART is especially well-suited to settings with unstructured predictor variables and substantial sources of unmeasured variation as is typical in the social, behavioral and health sciences. This paper develops a modified version of BART that is amenable to fast posterior estimation. We present a stochastic hill climbing algorithm that matches the remarkable predictive accuracy of previous BART implementations, but is many times faster and less memory intensive. Simulation studies show that the new method is comparable in computation time and more accurate at function estimation than both random forests and gradient boosting.
研究动机与目标
- 为解决标准 BART 的高计算成本问题,其依赖于缓慢的 MCMC 采样,尽管预测性能出色,但限制了其应用。
- 开发一种快速、可扩展的替代 MCMC 的 BART 方法,同时保持贝叶斯不确定性量化和对超参数选择的鲁棒性。
- 使 BART 成为在具有复杂、非结构化预测变量的场景下,非线性函数估计的默认高性能方法。
- 证明一种随机、贪心的搜索策略可以达到或超越基于 MCMC 的 BART 及其他领先树模型(如 XGBoost 和随机森林)的精度。
提出的方法
- XBART 用一种随机爬山算法替代 BART 中的 MCMC 后验模拟,该算法通过选择能最大化数据后验概率的分割点,贪心地构建树。
- 该方法提出了一种基于先验预测分布的新分割准则,通过引入当前误差标准差 σ 的估计值,自适应地正则化树的生长。
- 采用从根节点开始的生长策略,仅扩展有前景的分支,从而降低计算开销。
- 通过依赖预测变量的先验处理变量选择和分割点自适应调整,提升模型拟合度并增强对树空间的探索。
- 算法采用随机提议机制,相比确定性优化器,能更充分地探索后验分布。
- 结合一种快速、近似的后验估计方法,避免了 MCMC 的预烧期和收敛问题,实现快速推理。
实验结果
研究问题
- RQ1非 MCMC 的随机爬山算法能否在显著更快的速度下,实现与基于 MCMC 的 BART 相当的预测精度?
- RQ2XBART 是否保持了 BART 对超参数选择的鲁棒性,并在无需大量调优的情况下提供可靠的不确定性估计?
- RQ3在不同数据生成机制下,XBART 与 XGBoost、随机森林和神经网络在精度和速度上的表现如何?
- RQ4在分割准则中通过 σ 估计实现的自适应正则化对模型性能有何影响?
- RQ5该算法能否扩展到更复杂的 BART 变体,如贝叶斯因果森林或对数线性 BART 模型?
主要发现
- 在模拟设置的平均表现中,XBART 的均方根误差(RMSE)比交叉验证调优后的 XGBoost 低 31%,且在大多数情况下速度更快。
- 在 n = 250,000 时,XBART 的精度比未调优的 XGBoost 高 3.5 倍,且比默认配置的 XGBoost 快 2.5 倍。
- 在低噪声环境下,XBART 的表现与标准 MCMC-BART 相当或略优;在高噪声环境下,XBART 显著优于 MCMC-BART,可能归因于对后验空间更优的探索。
- 在大样本量(n > 10,000)时,随机森林和传统 MCMC-BART 的运行速度变得难以接受,而 XBART 能高效扩展。
- 在低噪声环境下,神经网络和 XGBoost 表现更优,但 XBART 在所有噪声水平下均保持更优的精度,且无需调优。
- 基于先验信息获取的默认超参数设置在多种数据生成过程中均表现出色,证实了其鲁棒性及作为默认模型的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。