Skip to main content
QUICK REVIEW

[论文解读] Heteroscedastic BART Using Multiplicative Regression Trees

Matthew T. Pratola, Hugh Chipman|arXiv (Cornell University)|Sep 21, 2017
Optimal Experimental Design Methods参考文献 19被引用 14
一句话总结

本文提出 HBART,一种贝叶斯非参数回归模型,通过使用方差的树组合产品结构来扩展 BART,以建模异方差性,从而实现对条件均值和方差的灵活、非参数估计。该方法利用条件共轭性实现高效的 MCMC 推断,并在真实数据和模拟数据上展示了更优的预测分布拟合效果与推断洞察力。

ABSTRACT

BART (Bayesian Additive Regression Trees) has become increasingly popular as a flexible and scalable nonparametric regression approach for modern applied statistics problems. For the practitioner dealing with large and complex nonlinear response surfaces, its advantages include a matrix-free formulation and the lack of a requirement to prespecify a confining regression basis. Although flexible in fitting the mean, BART has been limited by its reliance on a constant variance error model. This homoscedastic assumption is unrealistic in many applications. Alleviating this limitation, we propose HBART, a nonparametric heteroscedastic elaboration of BART. In BART, the mean function is modeled with a sum of trees, each of which determines an additive contribution to the mean. In HBART, the variance function is further modeled with a product of trees, each of which determines a multiplicative contribution to the variance. Like the mean model, this flexible, multidimensional variance model is entirely nonparametric with no need for the prespecification of a confining basis. Moreover, with this enhancement, HBART can provide insights into the potential relationships of the predictors with both the mean and the variance. Practical implementations of HBART with revealing new diagnostic plots are demonstrated with simulated and real data on used car prices, fishing catch production and alcohol consumption.

研究动机与目标

  • 解决 BART 的同方差误差假设所导致的局限性,该假设在非线性、高维数据中可能引发不确定性校准不足与过拟合问题。
  • 开发一种非参数、无基函数的方法,利用树集成模型同时估计响应变量的条件均值与条件方差。
  • 实现对预测变量在均值与方差上影响的联合推断,揭示标准 BART 无法捕捉的关系。
  • 通过方差模型中的条件共轭性,实现计算高效的 MCMC 算法,避免密集协方差矩阵求逆。
  • 引入诊断工具如 H-证据与预测 QQ 图,以评估方差依赖性与完整预测分布的拟合效果。

提出的方法

  • 使用与标准 BART 相同的树组合和模型来建模条件均值,其中每棵树对均值函数贡献相加项。
  • 使用树组合乘积结构来建模条件方差,其中每棵树对方差贡献相乘项,从而实现灵活、非参数的方差表面估计。
  • 对方差采用对数尺度参数化,使得树组合结构在对数尺度上变为可加形式,从而实现条件共轭性。
  • 在方差参数上应用条件共轭先验,使 MCMC 算法中的吉布斯抽样步骤更加高效。
  • 利用带有随机搜索变量选择的自适应贝叶斯回归树,实现自动变量选择与不确定性量化。
  • 引入默认先验设定,需极少调参,其中均值模型中的超参数 κ 是基于交叉验证校准的主要目标。

实验结果

研究问题

  • RQ1能否通过树集成模型,构建一种非参数贝叶斯模型,同时且灵活地估计响应变量的条件均值与方差?
  • RQ2与同方差 BART 相比,将方差建模为树组合乘积结构是否能提升预测分布的拟合效果?
  • RQ3HBART 在多大程度上能够检测并建模预测变量依赖的方差?与真实世界数据中的标准 BART 相比表现如何?
  • RQ4所提出的诊断工具——H-证据图与预测 QQ 图——在评估异方差性与模型拟合效果方面有多有效?
  • RQ5HBART 是否能在高维设置下实现高效计算,尤其在存在复杂非线性关系时,且用户调参极少?

主要发现

  • 在已知均值与方差函数的模拟示例中,HBART 仅使用默认先验即实现了高度准确的估计,展现出优异的小样本性能。
  • 在二手车价格数据集中,HBART 检测到明显的异方差性,其中三个预测变量在方差模型中表现出高活动度,而均值模型中仅有两个,揭示了预测变量对变异性影响的差异。
  • 二手车数据的预测 QQ 图显示,HBART 有效捕捉了条件分布,表明其拟合效果优于同方差 BART。
  • 在渔业数据集中,异方差模型相比同方差 BART 拟合效果显著更优,尽管并非完美,且使用估计均值与方差的插值模型也表现相近。
  • 在酒精消费数据中,HBART 并未改善拟合效果,表明异方差性可能不存在或未被模型充分捕捉,与诊断图结果一致。
  • 使用 e-统计量总结预测 QQ 图进行交叉验证,证明在先验调优方面有效,仅需调整均值模型中的超参数 κ,表明实现复杂度较低。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。