Skip to main content
QUICK REVIEW

[論文レビュー] Stability of Random Forests and Coverage of Random-Forest Prediction Intervals

Yan Wang, Huaiqing Wu|arXiv (Cornell University)|Oct 28, 2023
Probabilistic and Robust Engineering Design被引用数 5
ひとこと要約

この論文は、$Y^2$ が重い尾を持たない(特に、$Y^2$ が重い尾を持たない)という緩いモーメント条件の下で、ランダムフォレストの理論的安定性を確立し、袋だたみ誤差から構築された予測区間の非漸近的カバレッジ保証を可能にする。この論文は、得られる予測区間が名目水準 $1 - \alpha$ に近いカバレッジ確率を達成することを証明しており、サンプルサイズが増加するにつれてその境界が $1 - \alpha$ に収束することを示している。

ABSTRACT

We establish stability of random forests under the mild condition that the squared response ($Y^2$) does not have a heavy tail. In particular, our analysis holds for the practical version of random forests that is implemented in popular packages like exttt{randomForest} in exttt{R}. Empirical results show that stability may persist even beyond our assumption and hold for heavy-tailed $Y^2$. Using the stability property, we prove a non-asymptotic lower bound for the coverage probability of prediction intervals constructed from the out-of-bag error of random forests. With another mild condition that is typically satisfied when $Y$ is continuous, we also establish a complementary upper bound, which can be similarly established for the jackknife prediction interval constructed from an arbitrary stable algorithm. We also discuss the asymptotic coverage probability under assumptions weaker than those considered in previous literature. Our work implies that random forests, with its stability property, is an effective machine learning method that can provide not only satisfactory point prediction but also justified interval prediction at almost no extra computational cost.

研究の動機と目的

  • RのrandomForestパッケージのような標準実装で使われる実用的ランダムフォレストアルゴリズムの理論的安定性を確立すること。
  • ランダムフォレストの経験的成功と理論的理解の間のギャップ、特に予測区間の妥当性に関して、それを埋める。
  • 袋だたみ誤差から導かれる予測区間の非漸近的カバレッジ境界を提供し、最小限の計算コストで信頼性の高い区間推定を可能にすること。
  • 安定性の性質を活用することで、分布に依存しない予測的推論の理論的裏付けをランダムフォレストに拡張すること。
  • 先行研究で要求されていたよりも弱い仮定の下で、漸近的カバレッジ挙動をどのように得られるかを調査すること。

提案手法

  • 出力が有界である袋だたみ推定器の安定性を基盤とし、訓練データの $Y$-値に基づく条件付き出力の上限を用いて、ランダムフォレストに適用する。
  • 確率的偏差境界を導入:$\mathbb{P}(|\mathsf{RF}_B(X) - \mathsf{RF}_B^{\backslash i}(X)| > \varepsilon_{n,B}) \leq \nu_{n,B}$、ここで $\varepsilon_{n,B}, \nu_{n,B} \to 0$ が $n, B \to \infty$ のとき成り立つ。
  • 形式 $\mathsf{RF}_B(X) \pm \text{quantile of } \{R_i\}$ の予測区間を構築する。ここで $R_i = |Y_i - \mathsf{RF}_B^{\backslash i}(X_i)|$ である。
  • 濃縮不等式と分布関数の一様等連続性を用いて、カバレッジ確率の非漸近的下限および上限を導出する。
  • 有界優越定理と極限の議論を適用し、緩い正則性条件の下で漸近的カバレッジが $1 - \alpha$ に収束することを示す。
  • 安定性を用いて、OOBに基づく予測区間の妥当性を正当化し、$n$ 回の1点除外フィットを必要としない。

実験結果

リサーチクエスチョン

  • RQ1単一の訓練点を省いた場合に予測にほとんど影響がないという意味で、ランダムフォレスト予測子がどの条件下で安定するのか。
  • RQ2ランダムフォレストの袋だたみ誤差から構築された予測区間が、緩いモーメント仮定のもとで保証されたカバレッジ確率を達成できるか。
  • RQ3サンプルサイズが増加するにつれて、OOBに基づく予測区間の非漸近的カバレッジ境界はどのように変化するか。
  • RQ4$Y^2$ の軽い尾の仮定をどれほど緩めても、安定性とカバレッジ保証を維持できるか。
  • RQ5先行研究よりも弱い仮定のもとで、OOBに基づく予測区間の漸近的カバレッジ確率はどの程度か。

主な発見

  • ランダムフォレストは、$Y^2$ が重い尾を持たない条件下で安定しており、$\mathbb{P}(|\mathsf{RF}_B(X) - \mathsf{RF}_B^{\backslash i}(X)| > \varepsilon_{n,B}) \leq \nu_{n,B}$ が成り立ち、ここで $\varepsilon_{n,B}, \nu_{n,B} \to 0$ が $n, B \to \infty$ のとき成り立つ。
  • OOBに基づく予測区間のカバレッジ確率は、$\mathbb{P}(|Y - \mathsf{RF}_B(X)| \leq q_{n,\alpha}\{R_i\} + \varepsilon_{n,B}) \geq 1 - \alpha - O(\sqrt{\nu_{n,B}})$ を満たし、非漸近的下限を提供する。
  • $Y$ が連続的(誤差が一意であることを保証)という追加仮定のもとで、上界は $\mathbb{P}(|Y - \mathsf{RF}_B(X)| \leq q_{n,\alpha}\{R_i\} - \varepsilon_{n,B}) \leq 1 - \alpha + \frac{1}{n+1} + O(\sqrt{\nu_{n,B}})$ となる。
  • 提示された条件のもとで、漸近的カバレッジ確率は $1 - \alpha$ に収束し、$\lim_{n \to \infty} \mathbb{P}(R \leq q_{n,\alpha}\{R_i\}) = 1 - \alpha$ が成り立つ。
  • 数値的証拠は、$Y$ がコーシー分布のような重い尾を持つ場合でも安定性が維持される可能性を示唆しているが、理論的枠組みでは $Y^2$ の軽い尾の仮定が必要である。
  • この手法により、標準的なランダムフォレストの学習にほとんど追加コストがなく、有効で計算効率の良い予測区間が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。