Skip to main content
QUICK REVIEW

[논문 리뷰] Impact of subsampling and pruning on random forests

Roxane Duroux, Erwan Scornet|arXiv (Cornell University)|2016. 03. 14.
Data Mining Algorithms and Applications참고 문헌 19인용 수 8
한 줄 요약

이 논문은 랜덤 포레스트 성능에 대한 서브샘플링과 프루닝의 영향을 조사하며, 매개변수를 최적화할 경우 완전히 서브샘플된 포레스트와 프루닝된 포레스트가 유사한 정확도를 달성함을 보여준다. 중앙값 포레스트 모델의 이론적 분석은 서브샘플링과 프루닝이 오차 감소에 동일한 영향을 미친다는 것을 밝혀내며, 서브샘플 크기 또는 트리 깊이를 신중히 선택할 경우 최적의 성능을 달성할 수 있음을 시사한다.

ABSTRACT

Random forests are ensemble learning methods introduced by Breiman (2001) that operate by averaging several decision trees built on a randomly selected subspace of the data set. Despite their widespread use in practice, the respective roles of the different mechanisms at work in Breiman's forests are not yet fully understood, neither is the tuning of the corresponding parameters. In this paper, we study the influence of two parameters , namely the subsampling rate and the tree depth, on Breiman's forests performance. More precisely, we show that fully developed sub-sampled forests and pruned (without subsampling) forests have similar performances, as long as respective parameters are well chosen. Moreover , experiments show that a proper tuning of subsampling or pruning lead in most cases to an improvement of Breiman's original forests errors.

연구 동기 및 목표

  • 서브샘플링 비율과 트리 깊이(노드 크기 또는 최대 노드 수를 통해)가 랜덤 포레스트 성능에 미치는 영향을 이론적으로 분석하는 것.
  • 서브샘플링과 프루닝이 랜덤 포레스트의 일반화 오차에 미치는 영향을 이해하기 위한 이론적 프레임워크를 수립하는 것.
  • 다양한 서브샘플링 및 프루닝 설정 간 성능을 비교하여 이론적 발견을 실증적으로 검증하는 것.
  • 브라이먼의 랜덤 포레스트에 대한 최적의 매개변수 조정 가이드라인을 제공하여 기본 설정을 초월하는 것.
  • 적절한 서브샘플링 또는 프루닝 조정을 통해 표준 랜덤 포레스트 설정보다 예측 오차를 향상시킬 수 있음을 보여주는 것.

제안 방법

  • 랜덤 포레스트 예측의 위험에 대한 상한을 유도하기 위해 '중앙값 포레스트'라고 불리는 이론적 모델을 분석한다.
  • 각 분할이 데이터 공간을 두 개의 동일한 부분으로 나누는 재귀적 분할 접근 방식을 사용하여 트리 구축을 모델링한다.
  • 숲 추정치가 진짜 회귀 함수로부터의 기대 제곱편차를 분석하여 예측의 분산에 대한 상한을 도출한다.
  • 집중 불등식과 종단 노드 내 데이터 포인트 수에 대한 재귀적 경계를 적용하여 분산 증가를 통제한다.
  • 중앙값 포레스트의 위험이 두 항의 합으로 제한됨을 확립한다. 하나는 트리 수와 관련되고, 다른 하나는 트리 깊이와 관련된다.
  • 로그 변환과 점근적 근사법을 사용하여 표본 크기 n과 차원 d에 대해 서브샘플 크기와 트리 깊이의 최적 값들을 유도한다.

실험 결과

연구 질문

  • RQ1서브샘플링 비율은 랜덤 포레스트의 일반화 오차에 어떻게 영향을 미치는가?
  • RQ2오차 감소 측면에서 서브샘플링과 프루닝 간 이론적 관계는 무엇인가?
  • RQ3서브샘플링 없이 프루닝만으로도 완전히 서브샘플된 포레스트와 유사한 성능을 달성할 수 있는가?
  • RQ4예측 오차를 최소화하기 위해 서브샘플 크기와 트리 깊이 사이의 최적 트레이드오프는 무엇인가?
  • RQ5다양한 매개변수 설정에서 이론적 오차 상한과 실증 성능 간의 비교는 어떻게 이루어지는가?

주요 결과

  • 서브샘플 크기와 트리 깊이의 매개변수를 최적화할 경우, 완전히 서브샘플된 포레스트와 프루닝된 포레스트가 유사한 성능을 달성한다.
  • 이론적 분석은 서브샘플링과 프루닝이 분산을 유사한 방식으로 감소시키며, 위험 상한에 동일한 영향을 미친다는 것을 보여준다.
  • 최적의 서브샘플 크기는 $ n^{\frac{\ln 2}{\ln 2 - \ln(1 - 3/(4d))}} $ 비례하며, 이는 표본 크기 n에 따라 증가하고 차원 d에 따라 영향을 받는다.
  • 최적의 트리 깊이(노드 크기 기준)는 서브샘플 크기의 로그 함수이며, $ k \approx \log_2(a_n) - 2 $ 로 표현되며, 이는 편향과 분산을 균형 잡는 데 기여한다.
  • 실증 실험 결과는 서브샘플링 또는 프루닝을 조정할 경우 기본 설정 대비 개선된 오차율을 달성함을 확인한다.
  • 유도된 위험 상한은 $ n^{\frac{\ln(1 - 3/(4d))}{\ln 2 - \ln(1 - 3/(4d))}} $ 로 감소하며, 이는 차원 d에 따라 영향을 받는 비다항 감소율을 나타낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.