[논문 리뷰] Uncertainty-based out-of-distribution detection requires suitable function space priors.
이 논문은 베이지안 신경망(BNNs)이 사전적 불확실성으로 인해 분포 외(OOD) 탐지에서 본질적으로 뛰어나다고 보는 가정을 도전한다. 표준 신경망 아키텍처가 무한한 너비 근처에서 커널을 통해 함수 공간 사전분포를 유도함으로써 데이터 분포의 변화를 반영하지 못함을 보여주며, 이는 BNN이 명시적인 사전 설계 없이 OOD 탐지에 효과적이지 않음을 의미한다.
The need to avoid confident predictions on unfamiliar data has sparked interest in out-of-distribution (OOD) detection. It is widely assumed that Bayesian neural networks (BNNs) are well suited for this task, as the endowed epistemic uncertainty should lead to disagreement in predictions on outliers. In this paper, we question this assumption and show that proper Bayesian inference with function space priors induced by neural networks does not necessarily lead to good OOD detection. To circumvent the use of approximate inference, we start by studying the infinite-width case, where Bayesian inference can be exact due to the correspondence with Gaussian processes. Strikingly, the kernels induced under common architectural choices lead to uncertainties that do not reflect the underlying data generating process and are therefore unsuited for OOD detection. Importantly, we find this OOD behavior to be consistent with the corresponding finite-width networks. Desirable function space properties can be encoded in the prior in weight space, however, this currently only applies to a specified subset of the domain and thus does not inherently extend to OOD data. Finally, we argue that a trade-off between generalization and OOD capabilities might render the application of BNNs for OOD detection undesirable in practice. Overall, our study discloses fundamental problems when naively using BNNs for OOD detection and opens interesting avenues for future research.
연구 동기 및 목표
- 베이지안 신경망(BNNs)이 분포 외(OOD) 데이터에 대해 신뢰할 수 있는 불확실성 추정을 자연스럽게 제공하는지 조사하는 것.
- 신경망 아키텍처가 유도하는 함수 공간 사전분포가 OOD 탐지 성능에 미치는 영향을 검토하는 것.
- 신경망의 무한한 너비 근처에서 정확한 베이지안 추론이 이루어져도 커널에 의해 유도되는 사전분포로 인해 여전히 낮은 OOD 탐지 성능을 보이는지 확인하는 것.
- 적절한 함수 공간 사전분포를 가중치 공간에 어떻게 구현할 수 있는지 탐색하고, 어떤 조건에서 가능한지 규명하는 것.
- BNN에서 일반화 능력과 OOD 탐지 능력 사이의 실용적 트레이드오프를 평가하는 것.
제안 방법
- 무한한 너비 근처에서 정확한 베이지안 추론이 가능한 가우시안 프로세스와의 대응을 통해 베이지안 신경망의 무한한 너비 근처를 분석한다.
- 일반적인 신경망 아키텍처(예: ReLU, SELU)에서 유도된 커널 함수를 유도하고, 그들의 함수 공간 사전분포 성질을 평가한다.
- 이러한 커널이 OOD 데이터에서 생성하는 불확실성 추정치를 진짜 데이터 생성 과정과 비교한다.
- 무한한 너비의 결과를 유한한 너비 네트워크로 확장하여 일관된 OOD 행동을 보임을 보인다.
- 유리한 함수 공간 성질을 가중치 공간 사전분포에 포함시킬 수 있는 가능성을 탐색하지만, 현재는 입력 도메인의 특정 부분에 국한되어 있다.
- BNN에서 모델 일반화 능력과 OOD 탐지 성능 사이에 근본적인 트레이드오프가 존재함을 밝힌다.
실험 결과
연구 질문
- RQ1일반적인 아키텍처를 가진 표준 베이지안 신경망이 분포 외 입력에 대해 신뢰할 수 있는 불확실성 추정치를 제공하는가?
- RQ2신경망 커널이 유도하는 함수 공간 사전분포가 무한한 너비 근처에서 OOD 탐지 성능에 어떤 영향을 미치는가?
- RQ3유한한 너비 BNN에서 관찰된 낮은 OOD 탐지 성능은 근사 추론의 결과인가, 아니면 커널 구조 자체에 기인한 것인가?
- RQ4OOD 탐지에 유리한 함수 공간 성질을 가중치 공간 사전분포에 포함시킬 수 있으며, 만약 가능하면 어떤 도메인 범위에서 가능한가?
- RQ5일반화 능력과 OOD 탐지 능력 사이의 트레이드오프가 BNN의 OOD 탐지에 대한 실용적 유용성을 어느 정도 제한하는가?
주요 결과
- 일반적인 신경망 아키텍처는 무한한 너비 근처에서 커널 함수를 유도하며, 이는 진짜 데이터 생성 과정과 일치하지 않는 사전적 불확실성 추정치를 생성함으로써 OOD 탐지에 악영향을 미친다.
- OOD 탐지 실패 현상은 근사 추론의 산물이 아니며, 무한한 너비 영역에서 정확한 베이지안 추론 조건에서도 지속된다.
- 유한한 너비 네트워크에서 관찰된 OOD 행동은 그들의 무한한 너비 근처와 일관되며, 이는 문제의 근본적인 구조적 특성임을 시사한다.
- 유리한 함수 공간 성질을 가중치 공간 사전분포에 포함시킬 수는 있지만, 현재는 입력 도메인의 특정 부분에 국한되어 있으며 OOD 데이터에는 일반화되지 않는다.
- BNN에서 모델 일반화 능력과 OOD 탐지 능력 사이에 근본적인 트레이드오프가 존재할 수 있으며, 이는 실용적으로 BNN의 OOD 탐지에 대한 최적의 성능을 저해할 수 있다.
- 따라서 BNN을 OOD 탐지에 단순히 적용하는 것은 정확한 추론 조건에서도 유도된 함수 공간 사전분포의 내재적 결함으로 인해 문제가 된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.