Skip to main content
QUICK REVIEW

[논문 리뷰] Hierarchical Gaussian Process Priors for Bayesian Neural Network Weights

Theofanis Karaletsos, Thang D. Bui|arXiv (Cornell University)|2020. 02. 10.
Gaussian Processes and Bayesian Inference참고 문헌 33인용 수 4
한 줄 요약

이 논문은 유닛 수준의 잠재 변수를 사용하여 베이지안 신경망 가중치에 계층적 가우시안 프로세스 사전분포를 도입함으로써 상관 구조를 모델링하고, 커널 함수를 통해 입력 의존적 사전분포를 가능하게 하여 영향력 있는 사전 지식과 더불어 민감도 높은 불확실성 추정을 가능하게 한다. 이 방법은 분포 외 데이터에서 뛰어난 불확실성 추정 성능을 보이며, 활성 학습에서도 강력한 기준 모델들인 DKL과 MAP 추정을 능가하는 성능을 보인다.

ABSTRACT

Probabilistic neural networks are typically modeled with independent weight priors, which do not capture weight correlations in the prior and do not provide a parsimonious interface to express properties in function space. A desirable class of priors would represent weights compactly, capture correlations between weights, facilitate calibrated reasoning about uncertainty, and allow inclusion of prior knowledge about the function space such as periodicity or dependence on contexts such as inputs. To this end, this paper introduces two innovations: (i) a Gaussian process-based hierarchical model for network weights based on unit embeddings that can flexibly encode correlated weight structures, and (ii) input-dependent versions of these weight priors that can provide convenient ways to regularize the function space through the use of kernels defined on contextual inputs. We show these models provide desirable test-time uncertainty estimates on out-of-distribution data, demonstrate cases of modeling inductive biases for neural networks with kernels which help both interpolation and extrapolation from training data, and demonstrate competitive predictive performance on an active learning benchmark.

연구 동기 및 목표

  • 베이지안 신경망에서 독립적인 가중치 사전분포의 한계를 해결하기 위해, 가중치 상관관계를 포착하지 못하고 기능적 사전 지식을 표현할 수 있는 간결한 인터페이스가 부족한 문제를 해결한다.
  • 가중치에 대한 구조화되고 파rameter 효율적인 사전분포를 개발하여 캘리브레이션된 불확실성 추정과 주기성 또는 입력 맥락과 같은 사전 지식의 통합을 가능하게 한다.
  • 맥락적 입력에 대한 커널 기반 구성으로 입력 의존적 가중치 사전분포를 가능하게 하여 기능 공간의 행동을 정규화하면서도 가중치의 구조를 유지한다.
  • 직접 고차원 가중치 공간에서의 추론을 피하면서도 가중치 상관관계를 유지하는 효율적인 변분 추론 기법을 설계한다.
  • 강력한 기준 모델들과 비교하여 내삽, 외삽, 불확실성 추정, 활성 학습에서 향상된 성능을 입증한다.

제안 방법

  • 각 가중치 $w_{l,i,j}$ 가 연결된 잠재 코드 $[\mathbf{z}_{l,i}, \mathbf{z}_{l+1,j}]$ 에서의 매핑 함수 $f([\mathbf{z}_{l,i}, \mathbf{z}_{l+1,j}])$ 를 통해 생성되는 유닛 수준의 잠재 변수 $\mathbf{z}_{l,i}$ 를 사용한 계층적 사전분포를 제안한다.
  • 잠재 코드에서 가중치 평균을 생성하기 위해 메타넷(하이퍼넷) $\mathrm{NN}_\theta$ 를 활용하며, 가우시안 노이즈 모델을 사용하여 $p(\mathbf{w}|\mathbf{C}_w(\mathbf{z}), \theta) = \mathcal{N}(\mathbf{w}|\mathrm{NN}_\theta(\mathbf{C}_w(\mathbf{z})))$ 라 정의한다.
  • 유닛 잠재 변수 $\mathbf{z}$ 에 전역 GP 사전분포를 도입하여 $p(\mathbf{z}) = \prod \mathcal{N}(\mathbf{z}_{l,i}; \mathbf{0}, \mathbf{I})$ 를 정의함으로써 가중치 간의 구조화된 상관관계 모델링을 가능하게 한다.
  • 맥락적 입력에 대한 국소 커널 $k_{\text{local}}$ 을 정의하여 입력 의존적 사전분포를 확장함으로써 각 데이터 포인트에 대한 사전분포를 가능하게 하여 기능적 사전 지식을 표현한다.
  • 직접 고차원 가중치 공간에서의 추론을 피하면서도 가중치 상관관계를 유지하는 구조화된 변분 추론을 사용하여 잠재 변수 $\mathbf{z}$ 의 사후분포를 근사한다.
  • 전역 및 국소 커널을 조합한 제품 커널 구성 방식을 사용하여 입력 의존적 가중치 사전분포와 기능적 성질을 유연하게 모델링한다.

실험 결과

연구 질문

  • RQ1유닛 수준의 잠재 변수에 대한 계층적 GP 사전분포가 베이지안 신경망 내 가중치 상관관계를 효과적으로 모델링할 수 있는가?
  • RQ2맥락적 입력에 대한 커널 기반으로 구성된 입력 의존적 가중치 사전분포가 기능 공간에서의 일반화 및 불확실성 캘리브레이션을 향상시킬 수 있는가?
  • RQ3제안된 구조화된 변분 추론 전략이 가중치 상관관계를 유지하고, 평균장 근사보다 예측 성능과 불확실성 추정에서 뛰어난 성능을 보일 수 있는가?
  • RQ4정보적인 구조화된 사전분포와 불확실성 기반 선택 기준을 활용하여 활성 학습 성능을 향상시킬 수 있는가?
  • RQ5분포 외 데이터에서 DKL과 MAP과 같은 강력한 기준 모델과 비교해 불확실성 추정 성능에서 어떻게 성능을 냈는가?

주요 결과

  • 제안된 MetaGP 모델은 DKL과 MAP를 포함한 모든 비교 모델보다 분포 외 데이터에서 유의미하게 더 나은 불확실성 추정 성능을 보였다. 특히 DKL과 MAP는 예측에 대해 과신하는 경향을 보였다.
  • Kuzushiji-MNIST 데이터셋에서 모델은 예측 엔트로피가 분포 내 샘플과 분포 외 샘플을 명확히 구분할 수 있도록 뛰어난 불확실성 캘리브레이션 성능을 보였다.
  • UCI 회귀 데이터셋에서의 활성 학습에서 MetaGP 모델은 더 적은 수의 질의로 평균장 변분 추론과 비교해 유사하거나 더 뛰어난 예측 성능을 달성하여 효과적인 불확실성 기반 샘플링을 수행함을 시사한다.
  • MAP 추정은 분포 내 테스트 세트에서는 잘 작동하지만, 분포 외 데이터에서는 항상 열악한 불확실성 추정 성능을 보였으며, 이는 MetaGP 모델이 이를 효과적으로 개선함을 보여준다.
  • 구조화된 변분 추론 접근법은 가중치 상관관계를 성공적으로 유지하며, 고차원 가중치 공간에서의 직접 사후 추론 없이도 효율적인 학습을 가능하게 하였다.
  • 입력 의존적 사전분포를 위한 제품 커널의 사용은 주기성 또는 맥락 의존성과 같은 기능적 사전 지식을 모델에 통합할 수 있게 하여 내삽 및 외삽 성능을 모두 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.