Skip to main content
QUICK REVIEW

[论文解读] Trees-Based Models for Correlated Data

Assaf Rabinowicz, Saharon Rosset|arXiv (Cornell University)|Feb 16, 2021
Gaussian Processes and Bayesian Inference参考文献 33被引用 4
一句话总结

本文提出了一种新型基于树的模型 RETCO(用于相关数据的回归树),该模型明确将相关结构(如聚类、纵向或空间数据)整合到回归树、随机森林和梯度提升模型中。通过修改分裂准则、停止规则和叶节点预测,利用线性混合模型和高斯过程来考虑相关性,RETCO 在模拟和真实世界数据的多种领域中,显著提高了标准方法的预测准确性。

ABSTRACT

This paper presents a new approach for trees-based regression, such as simple regression tree, random forest and gradient boosting, in settings involving correlated data. We show the problems that arise when implementing standard trees-based regression models, which ignore the correlation structure. Our new approach explicitly takes the correlation structure into account in the splitting criterion, stopping rules and fitted values in the leaves, which induces some major modifications of standard methodology. The superiority of our new approach over trees-based models that do not account for the correlation is supported by simulation experiments and real data analyses.

研究动机与目标

  • 解决标准基于树的模型在处理相关数据时的局限性,后者常导致预测偏差和误差估计不准确。
  • 开发一个统一框架,将随机效应和随机场整合到基于树的模型中,以提升预测性能并支持统计推断。
  • 调整模型评估与选择技术以适应相关数据,确保在存在依赖结构的情况下实现无偏的一般化误差估计。
  • 在模拟和真实世界环境中,证明所提方法相对于标准基于树的模型及现有替代方法的优越性。

提出的方法

  • 提出 RETCO,一种新算法,通过修改分裂准则、停止规则和叶节点拟合值,显式考虑数据中已知的相关结构。
  • 通过使用固定效应和随机效应建模条件均值,将线性混合模型(LMM)和高斯过程回归整合到基于树的框架中。
  • 使用校正后的交叉验证损失函数(CV_c)来无偏估计相关数据的一般化误差,替代模型选择中的标准交叉验证。
  • 在空间或时间场景中,使用基于核的协方差函数(如指数型)来建模观测之间的依赖关系。
  • 采用递归分割策略,其中每个分裂通过最小化经相关性调整的损失函数实现,确保预测结果反映潜在的依赖结构。
  • 通过在多棵树中应用相关性感知的分裂和预测规则,支持随机森林和梯度提升等集成方法。

实验结果

研究问题

  • RQ1在标准基于树的模型中忽略相关性,对相关数据中的预测准确性和误差估计有何影响?
  • RQ2能否通过显式整合相关结构的修改后基于树的模型,在预测误差方面优于标准回归树、随机森林和梯度提升?
  • RQ3如何对相关数据进行模型选择和误差估计的校正,以避免交叉验证中的乐观偏差?
  • RQ4当应用于真实世界的相关数据集时,RETCO 相对于现有方法(如 RE-EM 或标准 RF)的性能增益如何?

主要发现

  • 在所有涉及相关数据的模拟和真实世界场景中,RETCO 显著降低了预测误差,优于标准基于树的模型。
  • 在随机效应方差(σ²_b)变化的模拟中,RETCO 始终优于标准模型,尤其在高相关性设置下,误差降低最高达 30%。
  • 校正后的交叉验证损失(CV_c)提供了无偏的一般化误差估计,而标准交叉验证在相关数据中低估了误差,导致过拟合。
  • 在真实数据分析中,RETCO 在五个不同数据集上的预测误差均低于标准随机森林:FIFA 球员价值、美国犯罪率、韩国气温预测、加州房价、帕金森病远程监测数据和工资数据。
  • 无论在 b*⊥b 还是 b*=b 的场景下,RETCO 均优于 RE-EM 方法,且当相关结构较强时,性能提升更为显著。
  • 该方法在不同类型数据中均保持稳定性能——包括聚类数据(FIFA、犯罪率)、空间数据(韩国气温)、纵向数据(帕金森病、工资)——展现出广泛的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。