Skip to main content
QUICK REVIEW

[论文解读] Transformation Forests

Torsten Hothorn, Achim Zeileis|arXiv (Cornell University)|Jan 9, 2017
Machine Learning and Data Classification参考文献 43被引用 10
一句话总结

本文提出转换森林(transformation forests),一种新颖的随机森林方法,通过由变换函数定义的参数分布族对条件分布进行建模。通过结合旨在检测分布变化(如方差漂移)的变换树与基于森林的聚合方法,该方法实现了灵活的、基于模型的推断,包括预测区间、变量重要性评估及自举方差估计,在检测非基于均值的异质性方面优于传统随机森林。

ABSTRACT

Regression models for supervised learning problems with a continuous target are commonly understood as models for the conditional mean of the target given predictors. This notion is simple and therefore appealing for interpretation and visualisation. Information about the whole underlying conditional distribution is, however, not available from these models. A more general understanding of regression models as models for conditional distributions allows much broader inference from such models, for example the computation of prediction intervals. Several random forest-type algorithms aim at estimating conditional distributions, most prominently quantile regression forests (Meinshausen, 2006, JMLR). We propose a novel approach based on a parametric family of distributions characterised by their transformation function. A dedicated novel "transformation tree" algorithm able to detect distributional changes is developed. Based on these transformation trees, we introduce "transformation forests" as an adaptive local likelihood estimator of conditional distribution functions. The resulting models are fully parametric yet very general and allow broad inference procedures, such as the model-based bootstrap, to be applied in a straightforward way.

研究动机与目标

  • 为解决标准随机森林仅建模条件均值且无法检测如方差漂移等分布变化的局限性。
  • 开发一种方法,对给定预测变量的响应变量的完整条件分布进行建模,从而支持更丰富的推断,如预测区间和分位数估计。
  • 提出变换树,通过评估参数族中参数的稳定性来检测分布变化。
  • 将随机森林扩展为完全参数化的框架,支持基于模型的自举、似然比检验及条件变量重要性。
  • 在统一的变换模型框架下,灵活建模各种响应类型,包括右删失和截断数据。

提出的方法

  • 该方法使用由变换函数定义的参数分布族,将响应变量映射到位置-尺度族,从而实现对条件分布的灵活建模。
  • 提出一种新颖的“变换树”算法,利用似然比检验检测能改善变换模型拟合度的分裂,而非依赖方差分析(ANOVA)或对数秩检验标准。
  • 转换森林通过聚合多个变换树实现,其中每棵树在终端节点通过最大似然法估计条件分布参数。
  • 预测基于加权经验分布函数,权重由森林结构中的接近度决定——具体而言,基于观测值共享终端节点的频率。
  • 该框架支持基于似然的变量重要性评估及基于模型的自举,用于评估变异性与显著性。
  • 提出一种替代加权方案,利用终端节点中估计分布参数之间的距离度量(如Kullback-Leibler散度),以提升接近度评估,超越传统树森林中的简单节点共享权重。

实验结果

研究问题

  • RQ1能否将随机森林框架扩展为建模响应变量的完整条件分布,而不仅限于其均值?
  • RQ2基于树的方法如何检测分布变化(如方差或尺度的改变),而非仅检测位置变化?
  • RQ3转换森林是否能比现有方法(如分位数回归森林)更准确地估计条件分位数和预测区间?
  • RQ4转换森林在捕捉分布异质性方面,能在多大程度上改进变量重要性评估?
  • RQ5在完全参数化的森林框架中,如何应用基于模型的推断(如自举、似然比检验)以实现稳健的统计推断?

主要发现

  • 转换森林在均匀预测变量中成功检测到方差漂移(在 .5 处),而传统分位数回归森林因依赖均值导向的分裂标准而失败。
  • 与仅对均值或风险率变化敏感的ANOVA或对数秩分裂相比,变换树算法在检测非位置型异质性(如方差变化)方面具有更高的统计功效。
  • 通过建模完整条件分布而非仅条件均值,该方法能够准确估计条件分位数和预测区间。
  • 基于模型的自举和似然比检验在转换森林框架内是可行的,从而可对参数稳定性与变量重要性进行推断。
  • 该框架可在统一的参数化变换模型下支持广泛的响应类型,包括删失和截断数据。
  • 基于终端节点中分布参数之间Kullback-Leibler散度的替代加权方案,相比传统树森林中的最近邻权重,能更优地估计接近度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。