Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian additive regression trees for probabilistic programming

Miriana Quiroga, Pablo Garay|arXiv (Cornell University)|2022. 06. 08.
Bayesian Modeling and Causal Inference인용 수 7
한 줄 요약

이 논문은 PyMC 프레임워크 내에서 베이지안 덧셈 회귀 트리(BART)를 일급 원자로 통합하는 확률 프로그래밍 확장인 PyMC-BART를 소개한다. BART를 다른 확률 모델과 함께 사용할 수 있도록 하면서도, 새로운 PGBART 샘플러를 통해 MCMC 추론을 네이티브로 지원함으로써 사용자는 최소한의 튜닝으로도 유연하고 불확실성 인식 모델을 구축할 수 있으며, PyMC 생태계의 추론, 진단 및 모델 비교 기능과 완전히 호환된다.

ABSTRACT

Bayesian additive regression trees (BART) is a non-parametric method to approximate functions. It is a black-box method based on the sum of many trees where priors are used to regularize inference, mainly by restricting trees' learning capacity so that no individual tree is able to explain the data, but rather the sum of trees. We discuss BART in the context of probabilistic programming languages (PPL), i.e., we present BART as a primitive that can be used as a component of a probabilistic model rather than as a standalone model. Specifically, we introduce the Python library PyMC-BART, which works by extending PyMC, a library for probabilistic programming. We showcase a few examples of models that can be built using PyMC-BART, discuss recommendations for the selection of hyperparameters, and finally, we close with limitations of our implementation and future directions for improvement.

연구 동기 및 목표

  • BART를 독립형 비모수 모델으로서의 기능과 확장 가능한 확률 프로그래밍 프레임워크 내에서의 모듈러 구성 요소로서의 기능 사이의 격차를 메우기 위해.
  • PyMC 생태계 내에서 임의의 확률 모델에 BART를 원활하게 통합하여, BART를 일급 랜덤 변수로 취급할 수 있도록 하기 위해.
  • BART 컴포넌트에 대해 효율적인 MCMC 샘플링을 지원하면서도 다른 PyMC 샘플러(NUTS 등)와의 호환성을 유지하는 스케일링 가능하고 모듈러한 추론 메커니즘인 PGBART를 제공하기 위해.
  • 전용 도구를 통해 변수 선택, 사후 해석 및 수렴 진단과 같은 고급 모델링 작업을 BART 기반 모델링 파이프라인에서 체계적으로 지원하기 위해.
  • 향후 확률 프로그래밍에서 BART의 확장성을 위한 기반을 마련하여, 고정 모델 구현을 넘어서 조합 가능하고 재사용 가능한 구성 요소로의 이동을 가능하게 하기 위해.

제안 방법

  • PyMC 내에서 새로운 BART 랜덤 변수를 도입하여, 사용자가 표준 PyMC 문법을 사용해 더 큰 확률 모델의 일부로 BART를 정의할 수 있도록 한다.
  • 새로운 PGBART(입자 게이지 BART) 샘플러를 구현하였으며, 이는 순차적 몬테 카를로(SMC) 원리를 활용하여 합의 각 트리들을 순차적으로 재샘플링하고, 반복마다 일부 트리들만 업데이트한다.
  • PGBART 샘플러는 입자 트리를 사용하여 가능한 트리 구조 공간을 탐색하며, 정규화된 로그우도 가중치에 기반한 재샘플링을 통해 높은 확률을 가진 트리를 선호한다.
  • 트리 성장은 깊이에 따라 가중되는 사전분포를 통해 지도되며, 파라미터 α=0.95와 β=2를 사용한다. 분할 변수 선택은 튜닝 중에 업데이트되는 동적이고 적응적인 다항 분포를 통해 이루어진다.
  • 잎 노드 값은 현재 예측 평균을 중심으로 하는 정규 사전분포를 갖으며, 잔차 표준편차에 비례하는 분산을 가지며 데이터 유형(예: 이항형 대비 연속형)에 따라 조정된다.
  • 변수 중요도는 분할 변수 사용 빈도를 누적 카운팅하는 방식으로 추정되며, 분할 비율에 대한 희박성 유도 딜레트 분포를 도입하여 해석 가능성을 향상시킨다.

실험 결과

연구 질문

  • RQ1BART를 독립형 비모수 모델이 아닌, PyMC와 같은 확률 프로그래밍 언어 내에서 일급 구성 요소로 효과적으로 통합하는 방법은 무엇인가?
  • RQ2모듈러한 확률 프로그래밍 프레임워크 내에서 BART에 대한 효율적이고 스케일링 가능한 추론을 가능하게 하는 샘플링 전략은 무엇인가?
  • RQ3조합 가능한 BART 기반 모델링 파이프라인에서 변수 중요도와 모델 해석 가능성을 어떻게 시스템적으로 지원할 수 있는가?
  • RQ4특히 트리의 수와 같은 초모수 선택이 실무에서 모델 성능과 수렴에 가장 크게 영향을 미치는가?
  • RQ5BART를 PyMC에 통합함으로써 기존의 모델 진단, 사후 점검 및 모델 비교 도구와의 호환성이 어떻게 유지될 수 있는가?

주요 결과

  • PyMC-BART는 사용자가 표준 PyMC 문법을 사용해 임의의 확률 모델 내에서 BART를 구성 요소로 조합할 수 있으며, 기존 워크플로우를 수정할 필요가 없다.
  • PGBART 샘플러는 반복마다 전체 트리 수의 10% 정도의 트리만 업데이트함으로써 효율적인 사후 탐색을 달성하며, 계산 비용을 줄이면서도 수렴성을 유지한다.
  • 변수 중요도는 분할 변수 사용 빈도를 추적하는 동적 카운팅 메커니즘을 통해 추정되며, 희박성 유도 사전분포가 해석 가능성을 향상시킨다.
  • ArviZ와 PyMC의 진단 스택과의 완전한 호환성을 유지하여, 사용자가 새로운 도구를 배우지 않고도 수렴성 평가, 모델 비교, 사후 분포 시각화를 수행할 수 있다.
  • 사후 예측 구간을 통한 불확실성 정량화를 지원하여, BART의 비모수 베이지안 모델링에서의 강점을 일관되게 유지한다.
  • 실증 결과는 PGBART 샘플러가 이항형 및 연속형 결과를 포함한 다양한 데이터 유형에서 안정적인 수렴과 정확한 사후 추정을 달성함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.