Skip to main content
QUICK REVIEW

[논문 리뷰] Improving predictions of Bayesian neural nets via local linearization

Alexander Immer, Maciej Jan Korzepa|arXiv (Cornell University)|2020. 08. 19.
Gaussian Processes and Bayesian Inference참고 문헌 42인용 수 10
한 줄 요약

이 논문은 일반화된 가우스-뉴턴(GGN) 근사로부터 유도된 국소 선형화 모델을 사용하여 기존 BNN 대신 'GLM 예측' 방법을 제안한다. 이 방법은 MAP 추정치 주변에서 BNN을 일반화된 선형 모델(GLM)로 간주함으로써 예측의 정확성과 캘리브레이션을 향상시킨다. 특히 과소적합 문제를 줄이고 분포 외 데이터 탐지 성능을 향상시키며, 다양한 데이터셋에서 표준 BNN 및 MAP 예측 대비 일관된 성능 향상을 보인다.

ABSTRACT

The generalized Gauss-Newton (GGN) approximation is often used to make practical Bayesian deep learning approaches scalable by replacing a second order derivative with a product of first order derivatives. In this paper we argue that the GGN approximation should be understood as a local linearization of the underlying Bayesian neural network (BNN), which turns the BNN into a generalized linear model (GLM). Because we use this linearized model for posterior inference, we should also predict using this modified model instead of the original one. We refer to this modified predictive as "GLM predictive" and show that it effectively resolves common underfitting problems of the Laplace approximation. It extends previous results in this vein to general likelihoods and has an equivalent Gaussian process formulation, which enables alternative inference schemes for BNNs in function space. We demonstrate the effectiveness of our approach on several standard classification datasets as well as on out-of-distribution detection. We provide an implementation at https://github.com/AlexImmer/BNN-predictions.

연구 동기 및 목표

  • 일반화된 가우스-뉴턴(GGN) 근사를 사용할 때 흔히 발생하는 라플라스 근사 BNN에서의 과소적합 문제를 해결하기 위해.
  • 베이지안 신경망에서 사후 근사와 예측 추론 간의 일관성 문제를 해결하기 위해.
  • 선형화된 모델 기반으로 예측 분포를 재정의하여 불확실성 캘리브레이션 및 분포 외 탐지 성능 향상시키기 위해.
  • 가우스 확률 과정 표현으로까지 확장 가능한 원칙적이고 모델에 종속되지 않는 프레임워크를 제공하기 위해.
  • 기존 BNN이 아닌 선형화된 모델(GLM)을 사용해 예측을 수행할 경우, 실증적으로 더 뛰어난 성능을 낼 수 있음을 보여주기 위해.

제안 방법

  • GGN 근사는 BNN의 MAP 추정치 주변에서의 국소 선형화로 해석되며, 이는 원래의 비선형 모델을 일반화된 선형 모델(GLM)로 변환한다.
  • 이 선형화된 GLM에 대해 라플라스 근사를 사용하여 사후 추론을 수행함으로써 매개변수에 대한 근사 사후 분포를 효율적으로 계산할 수 있다.
  • 예측 분포는 원래 BNN이 아닌 선형화된 GLM의 특징을 기반으로 계산되며, 이로써 'GLM 예측' 분포가 도출된다.
  • GLM 예측은 기능 공간 상에서 가우스 프로세스와 동치임을 입증하였으며, 커널 방법을 통한 대체 추론 기법을 가능하게 한다.
  • 이 방법은 가우스 및 비가우스 우도 모두를 포함한 분류 및 회귀 과제에 적용되었으며, 시그모이드 및 소프트맥스 출력도 포함된다.
  • 표준 벤치마크(MNIST, FMIST, CIFAR10)에서 평가되었으며, 예측 엔트로피와 AUC 점수를 활용해 분포 외 탐지 성능도 테스트되었다.

실험 결과

연구 질문

  • RQ1기존 BNN이 아닌 선형화된 모델(GLM)을 사용해 예측을 수행할 경우, 예측 성능 향상과 과소적합 감소에 기여하는가?
  • RQ2GLM 예측은 표준 BNN 예측 및 MAP 추론 대비 정확도, 캘리브레이션, OOD 탐지 성능에서 어떻게 비교되는가?
  • RQ3GLM 예측은 가우스 우도 외의 비가우스 우도로도 일반화 가능한가?
  • RQ4GLM 예측의 기능 공간 상 등가 가우스 프로세스 표현이 존재하는가? 그리고 이는 대체 추론 방법을 가능하게 하는가?
  • RQ5GLM 예측은 다양한 아키텍처와 데이터셋에서 기존 베이스라인을 일관되게 초월하는가?

주요 결과

  • GLM 예측은 MNIST에서 표준 BNN 예측 대비 높은 정확도(92.24% 대 92.12%)와 CIFAR10에서(77.44% 대 77.38%)를 기록하며, 음의 로그우도(NLL)와 기대 캘리브레이션 오차(ECE)도 감소시켰다.
  • MNIST/Fashion-MNIST OOD 탐지 과제에서 GLM 예측은 OOD-AUC 0.947을 기록하여 BNN 예측(0.905)과 MAP(0.892)를 모두 초월했다.
  • GLM 예측은 NLL 및 ECE 측면에서 BNN 예측 대비 일관되게 향상되었으며, MNIST에서는 ECE가 20% 감소했고, CIFAR10에서는 30% 감소했다.
  • 모든 테스트된 아키텍처와 데이터셋에서 GLM 예측이 OOD 탐지 성능에서 가장 뛰어나, MNIST/Fashion-MNIST 및 CIFAR10/SVHN 쌍에서 최고의 AUC 점수를 기록했다.
  • GLM 예측의 가우스 프로세스 등가 표현은 캘리브레이션 및 OOD 탐지 성능 향상을 보였으며, 이는 이론적 동치성과 함께 대체 추론 기법을 가능하게 함을 확인했다.
  • 조정된 사후 분포를 사용할 경우에도 이 방법은 효과적이며, 특히 OOD 탐지 성능에서 BNN 예측을 대부분의 지표에서 뛰어넘었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.