Skip to main content
QUICK REVIEW

[論文レビュー] Asymptotic Distributions and Rates of Convergence for Random Forests via Generalized U-statistics

Wei Peng, Tim Coleman|arXiv (Cornell University)|May 25, 2019
Neural Networks and Applications参考文献 55被引用数 14
ひとこと要約

本稿は一般化U統計量を用いてランダムフォレストの漸近正規性とBerry-Esseenの上限を確立し、先行研究よりも高速な収束速度とより広い適用範囲を実現する。ランダムフォレストの予測がより弱い条件下でも正規分布に収束することを示し、標本サイズと木の数に依存する明示的な上限を用いて収束速度を定量化する。

ABSTRACT

Random forests remain among the most popular off-the-shelf supervised learning algorithms. Despite their well-documented empirical success, however, until recently, few theoretical results were available to describe their performance and behavior. In this work we push beyond recent work on consistency and asymptotic normality by establishing rates of convergence for random forests and other supervised learning ensembles. We develop the notion of generalized U-statistics and show that within this framework, random forest predictions can potentially remain asymptotically normal for larger subsample sizes than previously established. We also provide Berry-Esseen bounds in order to quantify the rate at which this convergence occurs, making explicit the roles of the subsample size and the number of trees in determining the distribution of random forest predictions.

研究の動機と目的

  • 一貫性と漸近正規性を超えた理論的理解を深めるために収束速度を確立すること。
  • 不完全でランダム化され、高次のカーネルを許容する一般化U統計量フレームワークを構築すること。
  • ランダムフォレストの予測が正規分布にどの程度速く収束するかを定量化するBerry-Esseenの上限を導出すること。
  • 一般化U統計量が古典的U統計量に還元された場合、既存の文献よりも速い収束速度が得られることを示すこと。
  • 分割基準に対する正則性仮定を弱めた場合でも、ランダムフォレストの予測が漸近的に正規的である条件を提供すること。

提案手法

  • 不完全でランダム化され、階数が増加するカーネルを持つ一般化U統計量を導入し、アンサンブル予測の柔軟なモデリングを可能にする。
  • 置換に基づくU統計量の表現を用いて、標本抽出データを取り扱い、漸近的分布を導出する。
  • 基本推定量にサブガウス分布仮定を置き、Hoeffdingの不等式とモーメントバウンドを適用して指数的尾部バウンドを導出する。
  • 分布誤差を3つの成分に分解することでBerry-Esseenの上限を導出する:和の近似誤差、正規近似誤差、標本抽出バイアス。
  • 中心極限定理の近似誤差を制御するために、打ち切りと対称化の技術を用いる。
  • 標本サイズ $ s $、木の数 $ N $、基本学習器のモーメント条件の影響をバランスさせることで収束速度を確立する。

実験結果

リサーチクエスチョン

  • RQ1ランダムフォレストの予測がどの条件下で正規分布に収束し、その収束速度はどの程度か?
  • RQ2先行研究よりも弱い仮定の下で、ランダムフォレストの予測の収束速度をBerry-Esseenの上限で定量化できるか?
  • RQ3一般化U統計量フレームワークは、ランダム化、不完全、高次カーネルを許容するアンサンブル学習に古典的U統計量をどのように拡張するか?
  • RQ4標本サイズに従って増加するサブサンプルサイズの下で、ランダムフォレストの最適収束速度は何か?
  • RQ5木の数 $ N $ とサブサンプルサイズ $ s $ が、ランダムフォレストの予測の漸近的正規性と精度にどのように同時に影響を与えるか?

主な発見

  • 本稿は、ランダムフォレストの予測に対して、誤差率 $ Oigl( \frac{\nu_3}{\nu_2^{3/2} n^{1/2}} + \frac{\nu_3}{\nu_2^{3/2} N^{1/2}} + \bigl(\frac{s}{n}\bigr)^{1/3} + \bigl(\frac{s}{n}\bigr)^{1/2} \bigl(\frac{\nu_s}{s\nu_1} - 1\bigr)^{1/2} \bigr) $ のBerry-Esseenの上限を確立した。ここで $ \nu_k $ は基本推定量の $ k $ 階モーメントを表す。
  • 一般化U統計量が古典的U統計量に還元された場合、本稿で得られた収束速度は、既存の文献で確立されたものよりも速い。
  • 本フレームワークにより、より弱い条件下でもランダムフォレストの予測が漸近的に正規的であることが保証される。特に、より大きなサブサンプルサイズや分割基準に対する制限の少ない仮定が許容される。
  • 正規近似の最大誤差のバウンドは、$ n^{-1/2} $ と $ (s/n)^{1/3} $ を含む項に支配され、標本サイズとサブサンプルサイズの両方が収束速度に重要な影響を与えることを示している。
  • 基本推定量がサブガウス分布である場合、確率的偏差バウンド $ \text{Pr}(|U_{n,s} - \theta| \to 0) \to 1 $ が $ \text{exp}(-c \bigl(\frac{n}{s}\bigr)^{2\theta}) $ の速度で成り立ち、尾部の挙動が改善される。
  • 解析により、木の数 $ N $ とサブサンプルサイズ $ s $ が予測の分散に同時に影響を与えることが示され、$ n, N \to \infty $ のとき $ \text{Var}(\text{RF}) \to \frac{s^2 \nu_1}{n} + \frac{\nu_s}{N} $ となる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。