Skip to main content
QUICK REVIEW

[论文解读] Impact of subsampling and pruning on random forests

Roxane Duroux, Erwan Scornet|arXiv (Cornell University)|Mar 14, 2016
Data Mining Algorithms and Applications参考文献 19被引用 8
一句话总结

本文研究了子采样与剪枝对随机森林性能的影响,表明在参数最优调优时,完全子采样的森林与剪枝后的森林可达到相近的准确率。对中位数森林模型的理论分析显示,子采样与剪枝在误差减少方面具有等价效果,当子采样大小或树深被仔细选择时可实现最优性能。

ABSTRACT

Random forests are ensemble learning methods introduced by Breiman (2001) that operate by averaging several decision trees built on a randomly selected subspace of the data set. Despite their widespread use in practice, the respective roles of the different mechanisms at work in Breiman's forests are not yet fully understood, neither is the tuning of the corresponding parameters. In this paper, we study the influence of two parameters , namely the subsampling rate and the tree depth, on Breiman's forests performance. More precisely, we show that fully developed sub-sampled forests and pruned (without subsampling) forests have similar performances, as long as respective parameters are well chosen. Moreover , experiments show that a proper tuning of subsampling or pruning lead in most cases to an improvement of Breiman's original forests errors.

研究动机与目标

  • 理论分析子采样率与树深(通过节点大小或最大节点数表示)对随机森林性能的影响。
  • 建立理论框架,理解子采样与剪枝如何影响随机森林的泛化误差。
  • 通过比较不同子采样与剪枝配置下的性能,实证验证理论发现。
  • 为布雷曼随机森林提供最优参数调优指导,超越默认设置。
  • 证明通过合理调优子采样或剪枝,可使预测误差优于标准随机森林配置。

提出的方法

  • 分析一种称为“中位数森林”的理论模型,推导随机森林预测风险的上界。
  • 采用递归划分方法建模树的构建过程,其中每次分割将数据空间划分为两个相等部分。
  • 通过分析森林估计值与真实回归函数之间期望平方偏差,推导预测方差的上界。
  • 应用浓度不等式和终端节点中数据点数量的递归边界,控制方差增长。
  • 建立中位数森林风险的上界,其由两项之和构成:一项与树的数量相关,另一项与树的深度相关。
  • 通过对数变换与渐近近似,推导出以样本量 n 和维度 d 表示的最优子采样大小与树深。

实验结果

研究问题

  • RQ1子采样率如何影响随机森林的泛化误差?
  • RQ2在误差减少方面,子采样与剪枝之间存在何种理论关系?
  • RQ3在无子采样的情况下进行剪枝,能否实现与完全子采样森林相当的性能?
  • RQ4为最小化预测误差,子采样大小与树深之间最优权衡为何?
  • RQ5理论误差上界与不同参数设置下的实证性能相比如何?

主要发现

  • 当各自参数(子采样大小与树深)被最优调优时,完全子采样的森林与剪枝后的森林可实现相似性能。
  • 理论分析表明,子采样与剪枝以相似方式降低方差,对风险上界的影响等价。
  • 最优子采样大小与 $ n^{\frac{\ln 2}{\ln 2 - \ln(1 - 3/(4d))}} $ 成正比,随样本量 n 增大而增长,且依赖于维度 d。
  • 最优树深(以节点大小表示)与子采样大小的对数成正比,其中 $ k \approx \log_2(a_n) - 2 $,实现偏差与方差的平衡。
  • 实证实验证实,调优子采样或剪枝均可使误差率优于默认设置。
  • 推导出的风险上界以 $ n^{\frac{\ln(1 - 3/(4d))}{\ln 2 - \ln(1 - 3/(4d))}} $ 速率衰减,表明其为依赖于维度 d 的次多项式衰减率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。