Skip to main content
QUICK REVIEW

[论文解读] Optimal Weighted Random Forests

Xinyu Chen, Dalei Yu|arXiv (Cornell University)|May 17, 2023
Statistical Methods and Inference被引用 4
一句话总结

本文提出了两种最优加权策略——1 Step 和 2 Steps 最优加权随机森林——用于回归任务,利用马洛斯型准则根据各棵树的预测性能自适应地分配权重。这些方法通过最小化平方误差风险实现渐近最优性,在真实世界数据集上优于等权重和现有加权随机森林方法。

ABSTRACT

The random forest (RF) algorithm has become a very popular prediction method for its great flexibility and promising accuracy. In RF, it is conventional to put equal weights on all the base learners (trees) to aggregate their predictions. However, the predictive performances of different trees within the forest can be very different due to the randomization of the embedded bootstrap sampling and feature selection. In this paper, we focus on RF for regression and propose two optimal weighting algorithms, namely the 1 Step Optimal Weighted RF (1step-WRF$_\mathrm{opt}$) and 2 Steps Optimal Weighted RF (2steps-WRF$_\mathrm{opt}$), that combine the base learners through the weights determined by weight choice criteria. Under some regularity conditions, we show that these algorithms are asymptotically optimal in the sense that the resulting squared loss and risk are asymptotically identical to those of the infeasible but best possible model averaging estimator. Numerical studies conducted on real-world data sets indicate that these algorithms outperform the equal-weight forest and two other weighted RFs proposed in existing literature in most cases.

研究动机与目标

  • 为解决等权重随机森林性能欠佳的问题,基于各棵树的预测能力自适应地分配权重。
  • 开发理论基础坚实的加权策略,实现回归任务中最小化平方误差风险的渐近最优性。
  • 通过两步优化框架,在保持最优性能的同时降低计算成本。
  • 将模型平均原理从通用机器学习领域拓展至随机森林,尤其针对回归任务。
  • 为现有加权随机森林方法提供一种理论依据充分、计算高效的替代方案。

提出的方法

  • 提出 1step-WRF opt 和 2steps-WRF opt 两种算法,利用马洛斯型准则为基学习器(树)分配权重,以最小化预测误差。
  • 采用二次优化框架确定最优权重,确保所得估计量渐近等价于不可行的最佳可能模型平均估计量。
  • 引入两步算法,通过将优化限制在两个二次任务内,降低计算负担,提升可扩展性。
  • 利用条件期望和正则性条件(C.1–C.4)在异方差误差结构下建立理论性质。
  • 应用迭代期望定律、提取规则及勒贝格控制收敛定理,证明渐近最优性。
  • 推导加权估计量与虚oracle模型之间风险比的理论界,表明其在概率上收敛。

实验结果

研究问题

  • RQ1在随机森林中对单棵树进行自适应加权,是否能相比等权重策略提升回归性能?
  • RQ2能否构建一种理论最优的随机森林加权方案,使其渐近性能匹配最佳可能的模型平均估计量?
  • RQ3如何在保持理论最优性的同时降低加权随机森林估计的计算复杂度?
  • RQ4所提出的加权策略在真实世界回归数据集上的预测精度是否优于现有加权随机森林方法?
  • RQ5在异方差误差下,何种理论条件可确保加权随机森林估计量的渐近最优性?

主要发现

  • 所提出的 1step-WRF opt 和 2steps-WRF opt 方法实现渐近最优性,即其风险收敛至不可行的最佳可能模型平均估计量的风险。
  • 2steps-WRF opt 算法通过仅需两次二次优化任务显著降低计算成本,适用于大规模森林结构。
  • 在12个UCI数据集上的数值实验表明,两种方法在大多数情况下均优于等权重随机森林及两种现有加权随机森林方法。
  • 理论分析证实,在包括异方差性在内的正则性条件下,加权估计量的风险有界且收敛至最优风险。
  • 该方法对模型设定错误具有鲁棒性,在单棵树预测质量差异显著时仍能保持优异性能。
  • 使用马洛斯型准则进行权重选择,相比基线方法显著降低了均方误差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。