[논문 리뷰] Bayesian and empirical Bayesian forests
이 논문은 해석 가능성과 안정성을 향상시키기 위해 랜덤 포레스트를 비모수 베이지안 모델의 사후 표본으로 재해석하는 베이지안 숲(Bayesian Forests, BF)과 경험 베이지안 숲(Empirical Bayesian Forests, EBF)을 제안한다. EBF는 먼저 얕은 CART 트렁크를 먼저 피팅한 후 분지에 대해 포레스트 피팅을 병렬화하여 대규모 데이터에 효율적으로 스케일링되며, 전체 베이지안 숲과 예측 성능가운데 2% 이내를 달성하면서도 서브샘플링 방법보다 오차율에서 최대 38% 우수한 성능을 보인다.
We derive ensembles of decision trees through a nonparametric Bayesian model, allowing us to view random forests as samples from a posterior distribution. This insight provides large gains in interpretability, and motivates a class of Bayesian forest (BF) algorithms that yield small but reliable performance gains. Based on the BF framework, we are able to show that high-level tree hierarchy is stable in large samples. This leads to an empirical Bayesian forest (EBF) algorithm for building approximate BFs on massive distributed datasets and we show that EBFs outperform sub-sampling based alternatives by a large margin.
연구 동기 및 목표
- 랜덤 포레스트를 해석하고 개선하기 위한 비모수 베이지안 프레임워크를 개발하여 나무 구조에 대한 사후 표본 추출을 가능하게 한다.
- 특히 큰 표본에서 비모수 베이지안 DGP(데이터 생성 과정)에서 반복 샘플링 시 CART 나무의 안정성을 분석한다.
- 대규모 분산 데이터세트에서 근사 베이지안 숲을 구축하기 위한 효율적이고 확장 가능한 알고리즘인 경험 베이지안 숲(EBF)을 설계한다.
- 여러 실세계 데이터세트에서 서브샘플링 기반 분산 포레스트 방법보다 예측 정확도에서 뚜렷이 뛰어난 EBF의 성능을 입증한다.
- 모델의 가장 정보가 많은 부분에 계산 자원을 집중시켜 대규모 데이터 환경에서 신뢰할 수 있고 고성능의 트리 앙상블 학습을 가능하게 한다.
제안 방법
- 유한 지지에 대한 딜레트-다중이항 prior를 사용하여 데이터 생성 과정(DGP)에 대한 비모수 베이지안 모델을 정식화함으로써, 나무 구조에 대한 사후 표본 추출을 가능하게 한다.
- DGP에 대한 사후 분포에서 CART 나무를 표본 추출하는 베이지안 숲(BF) 알고리즘을 유도하며, 이는 랜덤 포레스트를 빈도주의적 근사로 간주한다.
- 나무 안정성에 대한 이론적 경계를 설정: 사후 DGP 실현값이 표본 CART 분할과 일치할 확률은 ≳ 1 − (p / √n) e^−n이며, 이는 큰 표본에서 상위 수준의 안정성을 나타낸다.
- 트렁크의 나무 구조를 사후 모드(전체 데이터에 대한 단일 CART 피팅을 통해)로 고정한 후 각 분지에서 독립적으로 포레스트를 표본 추출하는 경험 베이지안 숲(EBF)을 제안한다.
- Apache Spark와 같은 분산 컴퓨팅 프레임워크를 활용하여 각 분지에서 EBF를 병렬로 피팅함으로써 통신 비용을 최소화하고 확장성을 극대화한다.
- 최소 잎 크기와 트렁크 깊이를 조정 파rameter로 사용하여 계산 비용과 예측 성능 사이의 균형을 조절한다.
실험 결과
연구 질문
- RQ1랜덤 포레스트는 데이터 생성 과정에 대한 비모수 베이지안 모델의 근사 사후 표본으로 간주될 수 있는가?
- RQ2특히 큰 표본에서 기저 DGP의 다양한 실현값 간에 CART 나무는 얼마나 안정적인가?
- RQ3단일 트렁크를 피팅한 후 분지에서 독립적으로 포레스트를 피팅하는 이중 단계 접근법이 대규모 데이터에서 전체 베이지안 숲과 유사한 예측 성능을 달성할 수 있는가?
- RQ4EBF의 예측 정확도 및 확장성 측면에서 서브샘플링 기반 분산 포레스트 방법과 비교해 성능은 어떻게 되는가?
- RQ5EBF에서 트렁크 깊이, 분지 크기, 예측 오차 사이의 트레이드오프는 어떠한가?
주요 결과
- 캘리포니아 주택 데이터세트에서 EBF는 전체 베이지안 숲과 예측 성능가운데 2% 이내를 달성했으며, 서브샘플링 포레스트(SSF)는 10% 더 나쁘게 나타났다.
- 와인 품질 데이터세트에서는 EBF가 전체 BF보다 1% 더 나쁘게 나타났고, SSF는 루트 평균 제곱 오차에서 12% 더 나빴다.
- 맥주 브랜드 선택 예측 과제에서는 EBF가 BF보다 4.4% 더 나쁘게 나타났지만, SSF는 오분류율에서 38% 더 나빴다.
- EBF는 최소 잎 크기가 다양한 조건에서도 강건한 성능을 보였으며, 잎 크기를 반으로 줄였을 때 오차는 최대 7.6% 증가했고, 이는 의사결정나무의 29.5% 증가에 비해 훨씬 낮았다.
- eBay에서 1,200만 건의 거래 기록을 대상으로 EBF는 SSF 대비 오분류 오차를 1.3% 감소시켰으며, 추가로 20,000건 이상의 악성 구매자 경험을 탐지했다.
- 이론적 분석을 통해 큰 표본에서 상위 수준의 나무 구조가 매우 안정적이며, 분할 일치 확률이 ≳ 1 − (p / √n) e^−n임을 확인함으로써 EBF 접근법의 타당성이 뒷받침된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.