[论文解读] Regression-Enhanced Random Forests
本文提出回归增强型随机森林(RERFs),一种混合方法,通过整合惩罚性参数回归(Lasso)来提升随机森林的预测性能,尤其在外推和已知预测变量与响应变量之间关系的情况下表现更优。RERFs在模拟实验和真实世界玉米产量预测中均优于标准随机森林,特别是在预测值超出训练数据范围时表现更佳。
Random forest (RF) methodology is one of the most popular machine learning techniques for prediction problems. In this article, we discuss some cases where random forests may suffer and propose a novel generalized RF method, namely regression-enhanced random forests (RERFs), that can improve on RFs by borrowing the strength of penalized parametric regression. The algorithm for constructing RERFs and selecting its tuning parameters is described. Both simulation study and real data examples show that RERFs have better predictive performance than RFs in important situations often encountered in practice. Moreover, RERFs may incorporate known relationships between the response and the predictors, and may give reliable predictions in extrapolation problems where predictions are required at points out of the domain of the training dataset. Strategies analogous to those described here can be used to improve other machine learning methods via combination with penalized parametric regression techniques.
研究动机与目标
- 解决随机森林在外推和对预测变量与响应变量之间已知关系利用不足方面的局限性。
- 提升标准随机森林因预测结果有界而失效的回归问题中的预测准确性。
- 开发一种结合参数方法与非参数方法优势的广义随机森林框架。
- 通过惩罚性回归增强,实现对训练数据范围之外的可靠预测。
- 提供一种可调节的、基于交叉验证的超参数选择方法,用于该混合模型的最优参数配置。
提出的方法
- RERFs首先对训练数据应用Lasso回归,以建模预测变量对响应变量的主效应。
- 然后将Lasso拟合得到的残差作为响应变量,用于训练标准随机森林。
- 最终预测值为Lasso预测值与随机森林对残差的预测值之和。
- 该方法使用三个调优参数:Lasso惩罚参数(λ)、最小节点大小和每次分裂时尝试的预测变量数量(mtry)。
- 通过交叉验证进行调优,采用两步近似方法以降低计算成本。
- 该方法可推广为标准随机森林,当Lasso惩罚足够大时即退化为标准随机森林。
实验结果
研究问题
- RQ1将惩罚性参数回归与随机森林结合,是否能提升回归任务中的预测性能?
- RQ2在标准随机森林失效的外推场景中,该方法表现如何?
- RQ3RERFs能否有效整合预测变量与响应变量之间的已知函数关系,如非线性或单调性?
- RQ4在RERFs中,三个超参数(λ、nodesize、mtry)的最优调优策略是什么?
- RQ5该混合方法在具有复杂趋势的真实世界数据(如长期增产趋势)中是否保持鲁棒性并提升准确性?
主要发现
- 在模拟研究中,RERFs在预测超出训练范围时显著优于标准随机森林,尤其当预测变量值超出训练数据范围时表现更优。
- 在爱荷华州玉米产量预测中,RERFs的RMSE低于Lasso和随机森林,在2015年的预测精度比标准随机森林高出10%。
- 该方法成功捕捉了长期产量趋势,避免了标准随机森林因预测上限受限于训练数据中最大观测产量而造成的局限。
- RERFs在训练数据范围之外的预测中表现可靠,展示了在外样本外推中的优越性能。
- 两步交叉验证调优程序在降低计算成本的同时,保持了接近穷举搜索的预测性能。
- 在所有评估场景——模拟、混凝土强度和玉米产量——中,RERFs在插值和外推方面均持续优于标准随机森林。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。