Skip to main content
QUICK REVIEW

[论文解读] Asymptotic Distributions and Rates of Convergence for Random Forests via Generalized U-statistics

Wei Peng, Tim Coleman|arXiv (Cornell University)|May 25, 2019
Neural Networks and Applications参考文献 55被引用 14
一句话总结

本文通过广义U统计量建立了随机森林的渐近正态性与Berry-Esseen界,实现了比以往工作更快的收敛速度和更广的应用范围。研究表明,在较弱条件下,随机森林预测收敛于正态分布,并通过依赖于子样本大小和树的数量的显式界量化了收敛速率。

ABSTRACT

Random forests remain among the most popular off-the-shelf supervised learning algorithms. Despite their well-documented empirical success, however, until recently, few theoretical results were available to describe their performance and behavior. In this work we push beyond recent work on consistency and asymptotic normality by establishing rates of convergence for random forests and other supervised learning ensembles. We develop the notion of generalized U-statistics and show that within this framework, random forest predictions can potentially remain asymptotically normal for larger subsample sizes than previously established. We also provide Berry-Esseen bounds in order to quantify the rate at which this convergence occurs, making explicit the roles of the subsample size and the number of trees in determining the distribution of random forest predictions.

研究动机与目标

  • 将随机森林的理论理解从一致性和渐近正态性扩展至收敛速率的建立。
  • 构建一个广义U统计量框架,以容纳不完整、随机化和高阶核的集成估计器。
  • 推导出量化随机森林预测向正态性收敛速率的Berry-Esseen界。
  • 证明当退化为经典U统计量时,所提框架的收敛速率快于现有文献。
  • 提供在子样本大小更大且正则性假设更弱时,随机森林预测仍保持渐近正态性的条件。

提出的方法

  • 引入具有不完整、随机化且阶数递增的核的广义U统计量,以灵活建模集成预测。
  • 使用基于置换的U统计量表示法处理子样本数据并推导渐近分布。
  • 在基学习器服从次高斯假设的前提下,应用Hoeffding不等式与矩界推导指数尾部界。
  • 通过将分布误差分解为三部分(求和近似、正态近似与子采样偏差)来推导Berry-Esseen界。
  • 采用截断与对称化技术控制中心极限定理近似中的误差。
  • 通过平衡子样本大小 $ s $、树的数量 $ N $ 与基学习器的矩条件,建立收敛速率。

实验结果

研究问题

  • RQ1在何种条件下,随机森林预测收敛于正态分布,且收敛速度如何?
  • RQ2能否在弱于以往研究的假设下,使用Berry-Esseen界量化随机森林预测的收敛速率?
  • RQ3广义U统计量框架如何将经典U统计量扩展至允许在集成学习中使用随机化、不完整和高阶核?
  • RQ4当子样本大小随样本大小增长时,随机森林的最优收敛速率是什么?
  • RQ5树的数量与子样本大小如何共同影响随机森林预测的渐近正态性与准确性?

主要发现

  • 本文为随机森林预测建立了Berry-Esseen界,误差率为 $ O\bigl( \frac{\nu_3}{\nu_2^{3/2} n^{1/2}} + \frac{\nu_3}{\nu_2^{3/2} N^{1/2}} + \bigl(\frac{s}{n}\bigr)^{1/3} + \bigl(\frac{s}{n}\bigr)^{1/2} \bigl(\frac{\nu_s}{s\nu_1} - 1\bigr)^{1/2} \bigr) $,其中 $ \nu_k $ 表示基学习器的 $ k $ 阶矩。
  • 当广义U统计量退化为经典U统计量时,该收敛速率快于文献中已建立的任何速率。
  • 该框架允许在更弱条件下实现随机森林预测的渐近正态性,包括更大的子样本大小和对分裂准则更宽松的假设。
  • 正态近似最大误差的界主要由涉及 $ n^{-1/2} $ 和 $ (s/n)^{1/3} $ 的项主导,表明样本大小与子样本大小均显著影响收敛速度。
  • 当基学习器为次高斯时,本文推导出高概率偏差界 $ \text{Pr}(|U_{n,s} - \theta| \to 0) \to 1 $,收敛速率为 $ \text{exp}(-c \bigl(\frac{n}{s}\bigr)^{2\theta}) $,改善了尾部行为。
  • 分析表明,树的数量 $ N $ 与子样本大小 $ s $ 共同影响预测的方差,当 $ n, N \to \infty $ 时,有 $ \text{Var}(\text{RF}) \to \frac{s^2 \nu_1}{n} + \frac{\nu_s}{N} $。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。