Skip to main content
QUICK REVIEW

[논문 리뷰] Instance-Based Uncertainty Estimation for Gradient-Boosted Regression Trees

Jonathan Brophy, Daniel Lowd|arXiv (Cornell University)|2022. 05. 23.
Statistical Methods and Inference인용 수 5
한 줄 요약

이 논문은 기존의 기울기 부스팅 회귀 트리(GBRT) 모델에 k-최근접 이웃을 통해 학습 데이터에서 가장 유사한 인스턴스들을 활용하고, 트리 앙상블 커널을 사용해 예측 불확실성을 계산하는 IBUG라는 방법을 제안한다. IBUG는 22개의 데이터셋에서 최신 기술 수준의 확률적 성능을 달성하면서도 강력한 점 추정 정확도를 유지하며, 검증 데이터에서 조정된 스칼라 인자로 인해 탱글리한 사후 분포 모델링과 개선된 校정 성능을 가능하게 한다.

ABSTRACT

Gradient-boosted regression trees (GBRTs) are hugely popular for solving tabular regression problems, but provide no estimate of uncertainty. We propose Instance-Based Uncertainty estimation for Gradient-boosted regression trees (IBUG), a simple method for extending any GBRT point predictor to produce probabilistic predictions. IBUG computes a non-parametric distribution around a prediction using the $k$-nearest training instances, where distance is measured with a tree-ensemble kernel. The runtime of IBUG depends on the number of training examples at each leaf in the ensemble, and can be improved by sampling trees or training instances. Empirically, we find that IBUG achieves similar or better performance than the previous state-of-the-art across 22 benchmark regression datasets. We also find that IBUG can achieve improved probabilistic performance by using different base GBRT models, and can more flexibly model the posterior distribution of a prediction than competing methods. We also find that previous methods suffer from poor probabilistic calibration on some datasets, which can be mitigated using a scalar factor tuned on the validation data. Source code is available at https://www.github.com/jjbrophy47/ibug.

연구 동기 및 목표

  • 표본 데이터에 대한 회귀 트리 모델을 널리 사용하고 있음에도 불구하고 기울기 부스팅 회귀 트리(GBRT)가 불확실성 추정을 제공하지 못하는 문제를 해결하기 위해.
  • 기존에 훈련된 GBRT 모델을 재학습 없이도 校정된 확률적 예측을 생성할 수 있도록 하는 방법을 개발하기 위해.
  • 기존 방법이 분포 유형을 제한하는 것과는 달리, 예측 사후 분포 모델링의 유연성을 향상시키기 위해.
  • 예측 성능를 유지하면서도 트리 샘플링 전략을 통해 계산 효율성을 향상시키기 위해.
  • 이전 방법에서 관찰된 열악한 확률적 校정 성능를 개선하기 위해 검증 데이터에서 조정 가능한 스칼라 인자를 사용하기 위해.

제안 방법

  • IBUG는 GBRT의 점 추정 결과를 예측 분포의 평균으로 활용하며, 모델이 조건부 평균 추정에 뛰어난 정확도를 보임을 활용한다.
  • 인스턴스 간 유사도는 트리 앙상블 커널을 통해 정의되며, 앙상블 내 모든 트리에서 두 인스턴스가 같은 리프 노드에 함께 속하는 빈도로 측정된다.
  • 테스트 인스턴스에 대해 IBUG는 유사도가 가장 높은 k개의 훈련 인스턴스를 식별하여 불확실성을 추정한다.
  • 불확실성은 비모수적 방식으로 k-최근접 이웃을 기반으로 모델링되며, 이는 다양한 사후 분포 추정에 대한 높은 유연성을 제공한다.
  • 모든 GBRT 모델에 적용 가능한 워핑(wrapper) 방식으로 구현되며, 재학습이 필요 없고, k-최근접 이웃에 대해 파라미터적 또는 비모수적 분포 피팅을 모두 지원한다.
  • 특히 첫 번째에서 마지막 트리 순서로 샘플링하는 전략을 통해 런타임 성능가 향상되며, 성능 손실를 최소화하면서 계산량을 감소시킨다.

실험 결과

연구 질문

  • RQ1후처리(post-hoc) 방법이 기존의 GBRT 모델을 확장하여 신뢰할 수 있는 확률적 예측과 불확실성 추정을 제공할 수 있는가?
  • RQ2IBUG의 인스턴스 기반 불확실성 추정 방식이 NGBoost, PGBM, CBU와 같은 최신 기술 수준의 방법들과 비교해 확률적 성능와 점 추정 성능에서 어떻게 성능을 내는가?
  • RQ3IBUG가 다양한 기본 GBRT 모델을 사용함으로써 다양한 사후 분포를 탄력적으로 모델링할 수 있는가?
  • RQ4트리 샘플링 전략이 성능 저하 없이 추론 시간을 크게 줄일 수 있는가?
  • RQ5검증 데이터에서 조정된 스칼라 인자를 적용함으로써 IBUG와 다른 불확실성 추정 방법의 확률적 校정 성능를 향상시킬 수 있는가?

주요 결과

  • IBUG는 CRPS와 NLL를 측정 기준으로 하여 22개의 벤치마크 회귀 데이터셋에서 최신 기술 수준의 방법들과 비교해 유사하거나 더 뛰어난 확률적 성능를 달성한다.
  • 11개의 소규모 데이터셋에서 IBUG는 확률적 성능(CRPS)과 점 추정 성능(RMSE) 모두에서 BART를 앞서며, CRPS 기준으로 11-0-0의 승리-무승부-패배 기록을 기록한다.
  • 첫 번째에서 마지막 트리 순서로 샘플링 전략을 사용할 경우, 평균적으로 전체 트리의 5%만으로도 최적의 NLL 성능를 달성하며, 이는 추론 시간을 크게 단축시킨다.
  • IBUG는 k-최근접 이웃에 대해 임의의 파라미터적 또는 비모수적 분포를 사용해 사후 분포를 탄력적으로 모델링할 수 있으나, NGBoost, PGBM, CBU는 특정 분포에 제한되어 있다.
  • 검증 데이터에서 조정된 스칼라 인자를 적용함으로써 이전 방법에서 관찰된 열악한 校정 성능를 개선함으로써 확률적 校정 성능를 향상시킨다.
  • IBUG는 불확실성 추정 기능을 추가함에도 불구하고 최신 기술 수준의 점 추정 성능를 유지하며, 정확도와 신뢰성 모두가 요구되는 실세계 회귀 응용 분야에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.