Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Neural Network Ensembles

Tim Pearce, Mohamed Zaki|arXiv (Cornell University)|2018. 11. 27.
Gaussian Processes and Bayesian Inference참고 문헌 11인용 수 4
한 줄 요약

이 논문은 넓은 네트워크에서 일致한 사후 예측 샘플을 생성하기 위해 사전에 그린 가중치 주변의 매개변수 정규화와 함께 무작위 MAP 샘플링을 사용하는 베이지안 신경망 앙상블 방법을 제안한다. 사전 평균에 정규분포에서의 i.i.d. 샘플을 통해 노이즈를 주입함으로써, 이 방법은 레이어가 넓은 경우에만 5~10개의 모델로도 정확한 불확실성 추정을 달성하며, 회귀 과제에서 표준 앙상블 및 VI와 MC Dropout과 같은 근사 베이지안 방법보다 뛰어난 성능을 보인다.

ABSTRACT

Ensembles of neural networks (NNs) have long been used to estimate predictive uncertainty; a small number of NNs are trained from different initialisations and sometimes on differing versions of the dataset. The variance of the ensemble's predictions is interpreted as its epistemic uncertainty. The appeal of ensembling stems from being a collection of regular NNs - this makes them both scalable and easily implementable. They have achieved strong empirical results in recent years, often presented as a practical alternative to more costly Bayesian NNs (BNNs). The departure from Bayesian methodology is of concern since the Bayesian framework provides a principled, widely-accepted approach to handling uncertainty. In this extended abstract we derive and implement a modified NN ensembling scheme, which provides a consistent estimator of the Bayesian posterior in wide NNs - regularising parameters about values drawn from a prior distribution.

연구 동기 및 목표

  • 비용이 많이 들지 않는 MCMC나 변분 추론을 피하면서도 확장성 있고 실용적인 베이지안 신경망 추론 방법을 개발하는 것.
  • 딥러닝에서 경험적 앙상블 방법과 원칙적인 베이지안 불확실성 추정 간의 격차를 해소하는 것.
  • 적절하게 校정된 노이즈를 갖춘 랜덤라이즈드 MAP 샘플링이 넓은 신경망에서 진정한 사후분포를 일致적으로 근사할 수 있음을 보여주는 것.
  • 예측 불확실성을 효과적으로 포착하기 위해 오직 소수의 모델(5~10개)이면 충분한지 확인하는 것.

제안 방법

  • 이 방법은 무작위로 그린 사전 평균 주위에서 네트워크 매개변수를 정규화하는 수정된 손실 함수를 사용한다. 수식은 $\text{Loss}_{\text{anchor}} = \frac{1}{N}\|\mathbf{y}-\hat{\mathbf{y}}\|_2^2 + \frac{1}{N}\|\boldsymbol{\Gamma}^{1/2}(\boldsymbol{\theta}-\boldsymbol{\theta}_0)\|_2^2$ 로 정의되며, 여기서 $\boldsymbol{\theta}_0 \sim \mathcal{N}(\boldsymbol{\mu}_{\text{prior}}, \boldsymbol{\Sigma}_{\text{prior}})$ 이다.
  • 사전 평균 $\boldsymbol{\theta}_0$ 에 대한 노이즈 분포는 결과로 나오는 MAP 추정치가 올바른 사후 평균과 공분산을 갖도록 유도되며, $\boldsymbol{\Sigma}_0 = \boldsymbol{\Sigma}_{\text{prior}} + \boldsymbol{\Sigma}_{\text{prior}}^2 \boldsymbol{\Sigma}_{\text{like}}^{-1}$ 이다.
  • 넓은 신경망에서는 항 $\boldsymbol{\Sigma}_{\text{prior}}^2 \boldsymbol{\Sigma}_{\text{like}}^{-1}$ 가 소멸하므로, $\boldsymbol{\Sigma}_0 = \boldsymbol{\Sigma}_{\text{prior}}$ 를 타당한 근사로 사용할 수 있다.
  • 앙상블 내 각 모델은 서로 다른 $\boldsymbol{\theta}_0$ 를 사용하여 자동으로 손실을 최소화함으로써 독립적으로 훈련되며, 이는 사후 예측 분포에서 i.i.d. 샘플을 생성한다.
  • 이 방법은 이론적으로 타당하며, 넓은 네트워크에서 사후분포가 사전분포에 의해 지배된다는 가정 하에 성립한다. 이는 과도하게 파rameter화된 베이지안 신경망에서 성립한다.
  • 이 방법은 비선형 모델에서 복잡하고 일관성 없는 노이즈를 출력(예: 타깃)에 주입하는 것을 피하고, 유일한 노이즈 원천으로 사전 평균에 집중한다.

실험 결과

연구 질문

  • RQ1사전 평균에 노이즈를 주입한 랜덤라이즈드 MAP 샘플링이 넓은 베이지안 신경망에서 진정한 사후분포의 일致한 추정자로 작용할 수 있는가?
  • RQ2예측 공간에서 신뢰할 수 있는 불확실성 추정을 얻기 위해 앙상블에 얼마나 많은 모델이 필요한가?
  • RQ3표준 앙상블 방법이 분포 외 영역에서 지식 불확실성(에피스테믹 불확실성)을 포착하지 못하는 이유는 무엇이며, 이는 적절한 사전 정규화를 통해 수정될 수 있는가?
  • RQ4MCMC나 변분 추론을 요구하지 않으면서도 골드 스탠다드 베이지안 추론(예: HMC 또는 GP)을 단순하고 확장 가능한 방법으로 근사할 수 있는가?
  • RQ5이 방법은 VI나 MC Dropout과 같은 기존의 확장 가능한 베이지안 딥러닝 접근법보다 매개변수 상관관계와 예측 불확실성을 더 잘 포착하는가?

주요 결과

  • 제안된 방법은 ReLU, 시그모이드 및 RBF 활성화 함수를 갖는 토이 회귀 문제에서 하이퍼몬티카를 기반으로 한 골드 표준과 가우시안 프로세스에 매우 가까운 예측 분포를 생성한다.
  • 이 방법은 평균-장성 VI와 MC Dropout보다 지식 불확실성을 더 잘 포착하며, 특히 내삽 영역에서 매개변수 상관관계를 모델링할 수 있다는 점에서 유리하다.
  • 일부 분산 과대추정이 있음에도 불구하고, 이 방법은 진정한 사후 예측 분포를 정성적으로 정확하게 근사한다.
  • 오직 5~10개의 모델만으로도 좋은 불확실성 추정이 가능하며, 이 수치는 입력 또는 출력 차원 수에 따라 증가하지 않는다.
  • 이 방법은 분포 외 영역에서 RBF 가우시안 프로세스의 행동을 정확히 재현하며, 학습 데이터에서 멀리 떨어진 영역에서 고신뢰도의 0 예측을 보인다.
  • 10개의 표준 벤치마크 데이터셋에서, 지식 불확실성이 주요한 불확실성 원천인 과제에서 딥 앙상블보다 우수한 성능을 보이며, 더 나은 불확실성 정량화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.