Skip to main content
QUICK REVIEW

[논문 리뷰] The art of BART: Minimax optimality over nonhomogeneous smoothness in high dimension

Seonghyun Jeong, Veronika Ročková|arXiv (Cornell University)|2020. 08. 15.
Statistical Methods and Inference인용 수 4
한 줄 요약

이 논문은 고차원 함수 추정에서 비균일하고 이방성의 부드러움 및 불연속성을 고려할 때 베이지안 덧셈 회귀 트리(BART)의 최소최대 최적성(minimax optimality)를 확립한다. 새로운 종류의 희소(piecewise) 이방성 비균일 헬더 함수 클래스를 도입하고 딜레트 집합 선택 사전을 활용하여, 등방성 또는 균일성 가정 없이도 BART가 최소최대 최적의 사후 수축 속도를 달성함을 증명한다. 이는 복잡한 실제 시나리오에서 가우시안 프로세스 및 기타 일반적인 머신러닝 도구보다 뛰어난 성능을 보인다.

ABSTRACT

Many asymptotically minimax procedures for function estimation often rely on somewhat arbitrary and restrictive assumptions such as isotropy or spatial homogeneity. This work enhances the theoretical understanding of Bayesian additive regression trees under substantially relaxed smoothness assumptions. We provide a comprehensive study of asymptotic optimality and posterior contraction of Bayesian forests when the regression function has anisotropic smoothness that possibly varies over the function domain. The regression function can also be possibly discontinuous. We introduce a new class of sparse {\em piecewise heterogeneous anisotropic} Hölder functions and derive their minimax lower bound of estimation in high-dimensional scenarios under the $L_2$-loss. We then find that the Bayesian tree priors, coupled with a Dirichlet subset selection prior for sparse estimation in high-dimensional scenarios, adapt to unknown heterogeneous smoothness, discontinuity, and sparsity. These results show that Bayesian forests are uniquely suited for more general estimation problems that would render other default machine learning tools, such as Gaussian processes, suboptimal. Our numerical study shows that Bayesian forests often outperform other competitors such as random forests and deep neural networks, which are believed to work well for discontinuous or complicated smooth functions. Beyond nonparametric regression, we also examined posterior contraction of Bayesian forests for density estimation and binary classification using the technique developed in this study.

연구 동기 및 목표

  • 비균일 부드러움 가정을 완화한 조건 하에서 베이지안 숲의 성능을 분석함으로써 기존 이론적 격차를 메우기.
  • 일반적으로 등방성 또는 균일성에 기반한 제한적인 가정을 둔 기존 점근적 최소최대 이론과는 달리, 실세계 데이터에서 흔히 나타나는 공간적으로 변화하는 부드러움을 반영하기.
  • 조각별로 비균일하고 이방성의 부드러움을 가지며 불연속성이 허용되는 새로운 함수 클래스를 개발하여 더 현실적인 비모수적 함수 추정을 가능하게 하기.
  • 디리클레 부분집합 선택 사전을 사용한 BART가 이 일반적인 함수 클래스 전반에서 최소최대 최적의 속도로 사후 수축을 달성함을 증명하기.
  • 이론적 결과를 회귀를 넘어서 밀도 추정 및 이元분류로 확장하여 이 프레임워크의 광범위한 적용 가능성을 입증하기.

제안 방법

  • 각 직사각형 부분영역에서 별개의 이방성 부드러움 수준을 가진 새로운 함수 클래스인 조각별 비균일 이방성 헬더 함수를 도입하며, 부드러움은 영역 간으로 변화할 수 있고 불연속성도 허용한다.
  • 이 새로운 함수 클래스에 대해 고차원 설정에서 $L_2$-손실 하의 최소최대 하한선을 유도하여 최적성의 이론적 기준을 설정한다.
  • 트리 분할에 딜레트 사전을, 회귀 계수에 희소 부분집합 선택 사전을 적용하여 미지의 부드러움과 불연속성에 적응 가능한 희소성과 유연성을 유도한다.
  • 사후 수축 이론을 적용하여, 부드러움이 공간적으로 변화하고 사전에 알려져 있지 않은 경우에도 BART 사후가 최소최대 속도로 집중됨을 보인다.
  • 디리클레 과정의 스틱 브레이킹 표현을 활용하여 희소 복원 확률의 상한을 구하여, 사전이 낮은 차원의 관련 특징을 선호하도록 보장한다.
  • 특히 고차원에서 작은 수축 파라미터에 대해 유효한 감마 함수 성질과 농도 부등식을 활용하여 사후 집중의 이론적 상한을 수립한다.

실험 결과

연구 질문

  • RQ1고차원 회귀에서 비균일하고 이방성의 부드러움이 존재할 경우, 베이지안 숲이 최소최대 최적 추정 속도를 달성할 수 있는가?
  • RQ2입력 공간의 다양한 영역에서 부드러움이 다르거나 불연속성이 존재할 경우 BART의 성능은 어떻게 되는가?
  • RQ3조각별 비균일 이방성 함수의 일반적인 클래스에 대해 BART의 사후 수축 속도가 최소최대 하한선과 일치하는가를 증명할 수 있는가?
  • RQ4트리 기반 사전과 딜레트 부분집합 선택 사전의 조합이 사전 지식 없이도 희소성, 불연속성, 비균일 부드러움을 적응적으로 추정할 수 있는가?
  • RQ5이론적 결과가 회귀를 넘어서 밀도 추정 및 이원분류로 얼마나 넓게 확장되는가?

주요 결과

  • 논문은 불연속성이 허용되는 새로운 종류의 조각별 비균일 이방성 헬더 함수 클래스에 대해 고차원 비모수적 회귀에서 $L_2$-위험에 대한 최소최대 하한선을 확립한다.
  • 디리클레 부분집합 선택 사전을 사용한 BART는 부드러움이 영역과 방향에 따라 변화하더라도 최소최대 최적의 사후 수축 속도를 달성한다.
  • 진짜 함수 $\eta^*$의 $\epsilon$-근접 이웃 내에 있을 사후 확률은 $\exp\{-C\xi s\log(p/\epsilon)\}$ 이하로 하한이 존재하여 효과적인 집중이 확인된다.
  • 사전은 활성 변수 수가 $s$를 초과하는 구성에 대해 지수적으로 작은 확률을 할당함으로써 희소성을 보장한다. $\Pi(\min_{|S|=s} \sum_{j\notin S} \eta_j \geq \epsilon) \leq \exp\{-C(\xi-1)s\log p - \log \epsilon\}$.
  • 이론적 결과는 BART가 알려지지 않은 부드러움, 불연속성, 희소성에 적응함을 보여주며, 복잡한 설정에서 가우시안 프로세스 및 기타 일반적인 머신러닝 도구를 능가함을 입증한다.
  • 수치 실험은 BART가 불연속적이거나 매우 비균일한 부드러움을 가지는 함수를 추정할 때 랜덤 포레스트와 딥 네트워크를 능가함을 확인하여 이론적 주장의 실증적 타당성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.