[논문 리뷰] The Peril of Popular Deep Learning Uncertainty Estimation Methods
이 논문은 인기 있는 딥러닝 불확실성 추정 방법에서 심각한 결함을 드러낸다: 몬테 카를로 드롭아웃(Monte Carlo Dropout, MCDropout)과 베이지안 신경망(Bayesian Neural Networks, BNNs)은 일반적으로 분포 외(out-of-distribution, OOD) 샘플에 대해 낮은 불확실성을 부여하는 경향이 있으며, 이는 예상되는 행동과 정반대이다. 반면 가우시안 프로세스(Gaussian Processes, GPs)는 이러한 샘플을 높은 불확실성으로 정확히 식별한다. 연구는 2차원 토이 데이터와 MNIST, CIFAR-10과 같은 실제 데이터셋을 통해 이 결함을 실증적으로 입증하며, MCDropout와 BNNs가 OOD 입력을 탐지하지 못하는 반면, GPs는 커널 기반의 거리 인식 능력 덕분에 성공함을 보여준다.
Uncertainty estimation (UE) techniques -- such as the Gaussian process (GP), Bayesian neural networks (BNN), Monte Carlo dropout (MCDropout) -- aim to improve the interpretability of machine learning models by assigning an estimated uncertainty value to each of their prediction outputs. However, since too high uncertainty estimates can have fatal consequences in practice, this paper analyzes the above techniques. Firstly, we show that GP methods always yield high uncertainty estimates on out of distribution (OOD) data. Secondly, we show on a 2D toy example that both BNNs and MCDropout do not give high uncertainty estimates on OOD samples. Finally, we show empirically that this pitfall of BNNs and MCDropout holds on real world datasets as well. Our insights (i) raise awareness for the more cautious use of currently popular UE methods in Deep Learning, (ii) encourage the development of UE methods that approximate GP-based methods -- instead of BNNs and MCDropout, and (iii) our empirical setups can be used for verifying the OOD performances of any other UE method. The source code is available at https://github.com/epfml/uncertainity-estimation.
연구 동기 및 목표
- MCDropout와 BNNs와 같은 널리 사용되는 불확실성 추정(UE) 방법의 분포 외(OOD) 샘플 탐지 능력에 대한 신뢰성을 조사하기 위해.
- 정확한 OOD 탐지로 알려진 황금 표준인 가우시안 프로세스(Gaussian Processes, GPs)와의 성능 비교를 위해.
- 실제 응용 상황에서 MCDropout와 BNNs가 OOD 입력에 대해 높은 불확실성을 할당하지 못함을 실증적으로 입증하기 위해.
- GPs 기반 방법이 커널 기반 유사성 모델링 덕분에 OOD 탐지에서 더 견고한 이유에 대한 분석적 및 실증적 근거를 제공하기 위해.
제안 방법
- 연구는 2차원 토이 데이터셋을 사용하여 GP, MCDropout, BNNs의 불확실성 추정을 분포 내 및 분포 외 영역에서 비주얼 및 정량적으로 비교한다.
- 실제 데이터셋 평가를 위해 논문은 CIFAR-10에서 ResNet-18을 훈련시키고, 훈련 중에 볼 수 없었던 CIFAR-100 샘플을 OOD 데이터로 사용하며, 출력 엔트로피를 통해 불확실성 수준을 측정한다.
- BNNs는 평균장 변분 추론(Mean-Field Variational Inference, MFVI)과 해밀토니안 몬테카를로(Hamiltonian Monte Carlo, HMC)를 모두 사용하여 추론 방법의 불확실성 추정에 미치는 영향을 평가한다.
- GP 모델은 분류 작업에 라플라스 근사를 사용하며, 함수 값에 대한 사후 분포의 분산에서 예측 불확실성을 유도한다.
- 불확실성은 예측 클래스 분포의 엔트로피를 사용하여 정량화한다: $\mathcal{H}({\bm{x}},{\bm{\omega}}) = -\sum_{c\in C}\hat{{\bm{y}}}_{c}\log\hat{{\bm{y}}}_{c}$.
- 이론적 분석은 테스트 포인트와 훈련 포인트 사이의 커널 벡터 $\mathbf{k}_{\star}$ 가 작을 경우(즉, 테스트 포인트가 훈련 데이터에서 멀리 떨어져 있을 경우), GP의 불확실성이 최대에 가까워지며, 이는 이진 분류에서 엔트로피 ≈ 1에 수렴함을 보여준다. 이는 OOD 입력에 대해 높은 불확실성을 보장한다.
실험 결과
연구 질문
- RQ1MCDropout와 BNNs는 안전한 구현을 위해 요구되는 바와 같이 분포 외(OOD) 샘플에 대해 신뢰성 있게 높은 불확실성을 할당하는가?
- RQ2왜 MCDropout와 BNNs는 OOD 입력을 탐지하지 못하고, 가우시안 프로세스(GPs)는 성공하는가?
- RQ3MCDropout와 BNNs의 실패는 특정 아키텍처나 훈련 절차의 산물이 아니라 이론적 한계인가?
- RQ4GPs의 커널 기반 거리 인식 능력이 그들의 뛰어난 OOD 탐지 성능과 공식적으로 연결될 수 있는가?
- RQ5MNIST와 CIFAR-10과 같은 실제 데이터셋에서 MCDropout와 BNNs의 불확실성 추정은 GPs와 비교해 어떻게 다른가?
주요 결과
- 2차원 토이 데이터셋에서, MCDropout와 BNNs는 OOD 샘플에 대해 낮은 불확실성을 할당하는 반면, 가우시안 프로세스(GPs)는 높은 불확실성을 할당하여 이를 정확히 분포 외로 식별한다.
- MNIST에서 0과 1의 숫자만 훈련하고 2~9의 숫자를 테스트할 경우, MCDropout와 BNNs는 2~9 숫자에 대해 평균적으로 낮은 불확실성을 할당하여 OOD 탐지 능력이 떨어진다.
- CIFAR-10에서 ResNet-18을 CIFAR-10에서 훈련하고, 훈련 세트에 포함되지 않은 CIFAR-100 샘플을 테스트로 사용할 경우, MCDropout와 BNNs는 다시 한 번 낮은 불확실성을 할당하여 OOD 입력을 탐지하지 못한다.
- 이론적 분석은 GPs가 OOD 포인트에 대해 높은 불확실성을 할당하는 이유를 규명한다. 즉, 커널 벡터 $\mathbf{k}_{\star}$ 가 작아지면 예측 분산이 $k(\mathbf{x}_{\star},\mathbf{x}_{\star})$ 에 수렴하고 엔트로피가 1에 가까워지며, 이는 OOD 입력에 대해 높은 불확실성을 보장한다.
- MCDropout와 BNNs의 실패는 품질이 낮은 훈련이나 하이퍼파라미터 때문이 아니며, HMC 추론을 사용한 BNNs나 MCDropout에서 다수의 MC 샘플을 사용해도 여전히 문제가 지속된다.
- 결과는 현재의 UE 방법들이 BNNs나 드롭아웃의 가중치 공간 불확실성에 의존하기보다는, 커널을 통한 입력 유사성 모델링을 명시적으로 수행하는 GPs 유사 방법으로 대체되어야 한다는 것을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.