Skip to main content
QUICK REVIEW

[논문 리뷰] NGBoost: Natural Gradient Boosting for Probabilistic Prediction

Tony Duan, Anand Avati|arXiv (Cornell University)|2019. 10. 08.
Machine Learning in Healthcare인용 수 143
한 줄 요약

NGBoost는 자연 경사를 사용하여 다수의 분포 매개변수를 공동으로 부스팅함으로써 확률적 회귀를 확장하고, 보정된 예측 분포를 제공하며, 유연한 기본 학습자와 분포를 갖습니다.

ABSTRACT

We present Natural Gradient Boosting (NGBoost), an algorithm for generic probabilistic prediction via gradient boosting. Typical regression models return a point estimate, conditional on covariates, but probabilistic regression models output a full probability distribution over the outcome space, conditional on the covariates. This allows for predictive uncertainty estimation -- crucial in applications like healthcare and weather forecasting. NGBoost generalizes gradient boosting to probabilistic regression by treating the parameters of the conditional distribution as targets for a multiparameter boosting algorithm. Furthermore, we show how the Natural Gradient is required to correct the training dynamics of our multiparameter boosting approach. NGBoost can be used with any base learner, any family of distributions with continuous parameters, and any scoring rule. NGBoost matches or exceeds the performance of existing methods for probabilistic prediction while offering additional benefits in flexibility, scalability, and usability. An open-source implementation is available at github.com/stanfordmlgroup/ngboost.

연구 동기 및 목표

  • 회귀 작업에서 확률적 회귀와 불확실성 정량화의 필요성을 동기 부여합니다.
  • 다매개부스팅과 자연 경사를 통해 공변량의 함수로 분포 매개변수를 학습하는 모듈식 알고리즘 NGBoost를 제안합니다.
  • NGBoost가 유연하고(기본 학습자, 분포, 채점 규칙) 확장 가능하며 경쟁력 있는 확률적 예측을 제공함을 보여줍니다.
  • NGBoost를 기존의 확률적 회귀 방법과 비교하고, 자연 경사 및 다매개부스팅의 이점을 보여주는 ablation 분석을 수행합니다.

제안 방법

  • P(y|x)를 선택된 매개분포 P_theta로 표현하되, theta는 x의 함수로 학습됩니다.
  • 훈련 목표로 데이터셋 전체에 대해 적절한 채점 규칙 S(예: 로그가능도 L, CRPS)를 사용합니다.
  • 자연 경도 tilde{∇}S를 일반 기울기의 역함수로 선적 정보를 곱해 구합니다(Fisher 정보 또는 해당 S-발산 메트릭의 역).
  • 각 부스팅 단계에서 각 매개변수에 대한 자연 경도를 예측하도록 기본 학습자를 적합시키고, 그런 다음 단계별 스케일링 ρ^(m)과 공통 학습률 η로 선형 탐색 기반 업데이트를 수행합니다.
  • M단계의 부스팅을 반복하여 theta = theta^(0) - η sum_m ρ^(m) f^(m)(x) 를 얻고, 이로써 (예: Normal의 μ와 log σ와 같은) 여러 분포 매개변수를 동시에 모델링합니다.
  • 자연 경도 학습의 매개변수화 불변성과 계산 비용(선형적으로 N 및 매개변수 수 p에 비례; 기울기 역행렬은 p^3)을 논의하고 실용적 미니배치를 다룹니다.

실험 결과

연구 질문

  • RQ1NGBoost가 공변량의 함수로 여러 분포 매개변수를 공동으로 모델링함으로써 확률적 예측을 제공할 수 있는가?
  • RQ2다매개부스팅에서 자연 경도가 일반 경향 또는 2차 도함수 경도에 비해 학습 역학 및 예측 불확실성 보정에 도움이 되는가?
  • RQ3다양한 데이터셋과 분포에 대해 NGBoost가 최첨단 확률적 회귀 방법과 경쟁력이 있는가?
  • RQ4ablation(다매개부스팅, 자연 경사, 등분산 분산)의 제거가 성능에 어떤 영향을 미치는가?

주요 결과

  • NGBoost는 UCI 회귀 데이터셋에서 MC dropout, Deep Ensembles, Concrete Dropout, Gaussian Processes, GAMLSS, Distributional Forests를 상대로 음의 로그가능도(NLL)에서 경쟁력 있는 점수를 제공합니다.
  • 다매개부스팅과 자연 경사를 모두 사용하는 경우가 최적의 NLL을 달성하며, 이 두 구성요소 중 하나만 사용하는 구성보다 더 우수합니다.
  • NGBoost는 확률적 예측으로 NLL을 최적화하더라도 점추정에 대해 경쟁력 있는 RMSE를 제공합니다.
  • 자연 경사 기반 학습은 예시 및 매개변수 간의 업데이트를 더 균형 있게 수행하여 일반 경사에서 나타나는 과적합 및 미적합 문제를 피합니다.
  • 이 방법은 분포 매개변수 수 및 데이터셋 크기에 따라 표준 부스팅과 유사하게 확장 가능하며, 약간의 추가 비용이 듭니다.
  • NGBoost는 다양한 기본 학습자, 분포, 채점 규칙을 유연하게 허용하며, 실용적 사용성과 확장성을 입증합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.