Skip to main content
QUICK REVIEW

[논문 리뷰] Asymptotic Distributions and Rates of Convergence for Random Forests via Generalized U-statistics

Wei Peng, Tim Coleman|arXiv (Cornell University)|2019. 05. 25.
Neural Networks and Applications참고 문헌 55인용 수 14
한 줄 요약

이 논문은 일반화된 U-통계량을 사용하여 랜덤 포레스트의 점점 정규분포로 수렴하고, 이에 따른 베르리-에센 한계를 설정함으로써 이전 연구보다 더 빠른 수렴 속도와 더 넓은 적용 가능성을 확보한다. 랜덤 포레스트 예측이 더 약한 조건 하에서도 정규분포로 수렴함을 보이고, 표본 크기와 나무의 수에 따라 수렴 속도를 명시적인 한계를 통해 정량화한다.

ABSTRACT

Random forests remain among the most popular off-the-shelf supervised learning algorithms. Despite their well-documented empirical success, however, until recently, few theoretical results were available to describe their performance and behavior. In this work we push beyond recent work on consistency and asymptotic normality by establishing rates of convergence for random forests and other supervised learning ensembles. We develop the notion of generalized U-statistics and show that within this framework, random forest predictions can potentially remain asymptotically normal for larger subsample sizes than previously established. We also provide Berry-Esseen bounds in order to quantify the rate at which this convergence occurs, making explicit the roles of the subsample size and the number of trees in determining the distribution of random forest predictions.

연구 동기 및 목표

  • 일致성과 점점 정규분포 수렴성 이외의 이론적 이해를 확장하기 위해 수렴 속도를 설정하는 것.
  • 완전하지 않은, 무작위화된, 그리고 무한차수의 커널을 수용할 수 있는 일반화된 U-통계량 프레임워크를 개발하는 것.
  • 랜덤 포레스트 예측의 정규분포 수렴 속도를 정량화하는 베르리-에센 한계를 유도하는 것.
  • 기존의 고전적 U-통계량으로 축소되었을 때 제안된 프레임워크가 이전 문헌보다 더 빠른 수렴 속도를 제공함을 보이는 것.
  • 더 큰 표본 크기와 더 약한 정규성 가정 하에서도 랜덤 포레스트 예측이 점점 정규분포로 수렴하는 조건을 제공하는 것.

제안 방법

  • 완전하지 않은, 무작위화된, 그리고 증가하는 질량을 가진 커널을 가진 일반화된 U-통계량을 도입하여 앙상블 예측의 탄력적인 모델링을 가능하게 한다.
  • 서브샘플 데이터를 다루고 점점 분포를 유도하기 위해 U-통계량의 순열 기반 표현을 사용한다.
  • 기본 추정기의 하위가우시안 가정 하에 Hoeffding의 부등식과 모멘트 한계를 적용하여 지수 꼬리 한계를 도출한다.
  • 분포 오차를 세 부분으로 분해하여 베르리-에센 한계를 도출한다: 합의 근사, 정규분포 근사, 서브샘플링 편향.
  • 중앙극한정리 근사 오차를 제어하기 위해 절단과 대칭화 기법을 활용한다.
  • 서브샘플 크기 $ s $, 나무의 수 $ N $, 기본 학습기의 모멘트 조건 간의 균형을 맞추어 수렴 속도를 설정한다.

실험 결과

연구 질문

  • RQ1랜덤 포레스트 예측이 어떤 조건 하에서 정규분포로 수렴하며, 그 수렴 속도는 얼마나 되는가?
  • RQ2이전 연구보다 더 약한 가정 하에서도 베르리-에센 한계를 사용하여 랜덤 포레스트 예측의 수렴 속도를 정량화할 수 있는가?
  • RQ3일반화된 U-통계량 프레임워크는 고전적 U-통계량을 어떻게 확장하여 앙상블 학습에서 무작위화, 완전하지 않은, 고차수 커널을 허용하는가?
  • RQ4서브샘플 크기가 표본 크기와 함께 증가할 때 랜덤 포레스트의 최적 수렴 속도는 무엇인가?
  • RQ5나무의 수와 서브샘플 크기가 함께 랜덤 포레스트 예측의 점점 정규분포 수렴성과 정확성에 어떤 영향을 미치는가?

주요 결과

  • 논문은 랜덤 포레스트 예측에 대해 오차율 $ O\bigl( \frac{\nu_3}{\nu_2^{3/2} n^{1/2}} + \frac{\nu_3}{\nu_2^{3/2} N^{1/2}} + \bigl(\frac{s}{n}\bigr)^{1/3} + \bigl(\frac{s}{n}\bigr)^{1/2} \bigl(\frac{\nu_s}{s\nu_1} - 1\bigr)^{1/2} \bigr) $ 인 베르리-에센 한계를 설정한다. 여기서 $ \nu_k $ 는 기본 추정기의 $ k $-번째 모멘트를 나타낸다.
  • 일반화된 U-통계량이 고전적 U-통계량으로 축소될 경우, 이 논문에서 확보한 수렴 속도는 이전 문헌에서 확보한 어떤 것보다도 더 빠르다.
  • 이 프레임워크는 더 약한 조건 하에서도 랜덤 포레스트 예측의 점점 정규분포 수렴성을 허용하며, 더 큰 서브샘플 크기와 더 제한이 적은 분할 기준에 대한 가정을 수용한다.
  • 정규분포 근사에서의 최대 오차에 대한 한계는 주로 $ n^{-1/2} $ 과 $ (s/n)^{1/3} $ 를 포함하는 항들에 의해 지배되며, 이는 표본 크기와 서브샘플 크기가 수렴 속도에 결정적인 영향을 미친다는 것을 시사한다.
  • 기본 추정기가 하위가우시안일 경우, 논문은 $ \text{Pr}(|U_{n,s} - \theta| \to 0) \to 1 $ 의 고확률 편차 한계를 $ \text{exp}(-c \bigl(\frac{n}{s}\bigr)^{2\theta}) $ 의 속도로 도출한다. 이는 꼬리 행동을 향상시킨다.
  • 분석 결과, 나무의 수 $ N $ 과 서브샘플 크기 $ s $ 가 함께 랜덤 포레스트 예측의 분산에 영향을 미치며, $ n, N \to \infty $ 일 때 $ \text{Var}(\text{RF}) \to \frac{s^2 \nu_1}{n} + \frac{\nu_s}{N} $ 로 수렴한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.