Skip to main content
QUICK REVIEW

[논문 리뷰] Are Bayesian neural networks intrinsically good at out-of-distribution detection?

Christian Henning, Francesco D’Angelo|arXiv (Cornell University)|2021. 07. 26.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 베이지안 신경망(BNNs)이 고분포(out-of-distribution, OOD) 탐지에 본질적으로 유리하다는 가정을 도전한다. 무한한 넓이를 가진 네트워크에서 정확한 추론과 유한한 넓이를 가진 네트워크에서 하미르토니안 몬테카를로(HMC)를 사용하여, 일반적인 아키텍처가 표준 가중치 사전확률을 가질 경우 OOD 입력에 대해 의미 있는 지식적 불확실성(epistemic uncertainty)을 생성하지 못하는 커널을 유도한다는 점을 보여주며, 이는 BNN이 OOD 탐지기로서의 신뢰성을 떨어뜨린다.

ABSTRACT

The need to avoid confident predictions on unfamiliar data has sparked interest in out-of-distribution (OOD) detection. It is widely assumed that Bayesian neural networks (BNN) are well suited for this task, as the endowed epistemic uncertainty should lead to disagreement in predictions on outliers. In this paper, we question this assumption and provide empirical evidence that proper Bayesian inference with common neural network architectures does not necessarily lead to good OOD detection. To circumvent the use of approximate inference, we start by studying the infinite-width case, where Bayesian inference can be exact considering the corresponding Gaussian process. Strikingly, the kernels induced under common architectural choices lead to uncertainties that do not reflect the underlying data generating process and are therefore unsuited for OOD detection. Finally, we study finite-width networks using HMC, and observe OOD behavior that is consistent with the infinite-width case. Overall, our study discloses fundamental problems when naively using BNNs for OOD detection and opens interesting avenues for future research.

연구 동기 및 목표

  • 베이지안 신경망(BNNs)이 지식적 불확실성을 통해 고분포(OOD) 탐지에 본질적으로 가능할지 조사하기.
  • BNN이 불확실성 모델링 덕분에 자연스럽게 OOD 입력을 탐지할 수 있다는 광범위한 가정을 도전하기.
  • 무한한 넓이 근사에서 일반적인 신경망 아키텍처가 유도하는 커널 성질을 분석하고, 이들이 OOD 탐지에 미치는 영향을 탐색하기.
  • 유한한 넓이 네트워크에서 정확한 추론(HMC)을 사용해 OOD 성능을 평가하고, 이와 무한한 넓이 행동을 비교하기.
  • 가중치 공간 사전확률의 핵심적 역할과 예측 엔트로피에 애자기적 불확실성(aleatoric uncertainty)이 미치는 혼동 효과를 강조하기.

제안 방법

  • 연구는 완전히 연결된 네트워크의 무한한 넓이 근사에서 가우시안 프로세스(GP) 등가성을 사용하여, 네트워크 아키텍처와 가중치 사전확률에서 기인하는 유도 커널을 도출한다.
  • 표준 아키텍처(예: ReLU, RBF)의 커널 구조를 분석하고, 이들의 불확실성이 데이터 생성 분포를 반영하지 못함을 보여주며, 특히 OOD 영역에서 그러한 경향이 뚜렷하다.
  • 유한한 넓이 네트워크에서 정확한 베이지안 추론을 위해 하미르토니안 몬테카를로(HMC)를 사용하여 무한한 넓이 분석 결과를 검증한다.
  • 지식적 불확실성을 에너지 함수로 사용해 역방향 샘플링 방법을 도입하여 내분포 유사 샘플을 생성하고, OOD 탐지 일관성 여부를 검증한다.
  • 생성된 샘플과 학습 데이터를 discrepancy 측정법(예: MMD)을 사용해 정량적으로 비교하여, 불확실성이 진정으로 데이터 분포와 일치하는지 평가한다.
  • 예측 엔트로피를 사용해 OOD 탐지 성능을 평가하고, 특히 고차원 설정에서 애자기적 불확실성이 예측 엔트로피에 혼동을 줌을 확인한다.

실험 결과

연구 질문

  • RQ1표준 아키텍처와 사전확률을 가진 베이지안 신경망이 고분포 입력을 신뢰성 있게 식별할 수 있는 지식적 불확실성을 생성하는가?
  • RQ2무한한 넓이 근사에서 일반적인 신경망 아키텍처가 유도하는 커널 함수가 OOD 탐지 성능에 어떻게 영향을 미치는가?
  • RQ3근사 추론을 통해 유한한 넓이 BNN에서 관찰된 OOD 행동은 무한한 넓이 근사에서의 정확한 추론 결과와 일관한가?
  • RQ4가중치 공간 사전확률의 선택이 BNN의 OOD 탐지 능력에 어느 정도 영향을 미치는가?
  • RQ5지식적 불확실성을 사용해 내분포 샘플을 생성할 수 있으며, 이는 OOD 탐지의 신뢰성 있는 검증 방법이 될 수 있는가?

주요 결과

  • ReLU 또는 RBF 활성화를 가진 표준 완전히 연결된 네트워크의 무한한 넓이 근사에서 유도되는 커널은 진정한 데이터 분포를 반영하지 못하며, 이로 인해 OOD 탐지 성능이 열 劣하다.
  • 정확한 베이지안 추론(HMC) 조건에서도 표준 아키텍처를 가진 유한한 넓이 BNN이 무한한 넓이 사례와 일치하는 OOD 탐지 행동을 보이며, 이는 근본적인 아키텍처 한계를 시사한다.
  • 일부 네트워크 파라미터에서 유도되는 RBF 커널은 좋은 OOD 탐지 성능을 지원할 수 있지만, 이는 가중치 사전확률을 정밀하게 조정(예: 큰 $σ_{\mu}^2$)해야 가능하며, 이는 실무에서 일반적이지 않다.
  • 일반적으로 불확실성의 대체 지표로 사용되는 예측 엔트로피는 애자기적 불확실성에 의해 혼동되며, 따라서 BNN에서 OOD 탐지에 신뢰할 수 없다.
  • 표준 BNN의 지식적 불확실성은 기저 데이터 밀도 $p({\bm{x}})$를 신뢰성 있게 근사하지 못하며, 이는 내분포 샘플링을 위한 생성 모델로의 활용을 약화시킨다.
  • 이 연구는 OOD 탐지 성능이 가중치 공간 사전확률의 선택에 매우 민감하며, 부적절한 사전확률은 잘못된 불확실성 추정을 초래함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.