[논문 리뷰] Robustly representing uncertainty in deep neural networks through sampling
이 논문은 드롭아웃과 드롭컨넥트를 사용한 변분 추론을 통해 딥 네ural 네트워크에서 불확실성을 견고하게 표현하기 위한 샘플링 기반 방법을 제안한다. 베르누이 드롭아웃과 가우시안 드롭컨넥트를 조합함으로써 파rameter를 증가시키지 않고 스파이크-앤프레드 변분 분포를 근사함으로써, 단독으로 사용할 경우보다 더 높은 테스트 정확도와 더 신뢰할 수 있는 불확실성 校정을 달성한다.
As deep neural networks (DNNs) are applied to increasingly challenging problems, they will need to be able to represent their own uncertainty. Modeling uncertainty is one of the key features of Bayesian methods. Using Bernoulli dropout with sampling at prediction time has recently been proposed as an efficient and well performing variational inference method for DNNs. However, sampling from other multiplicative noise based variational distributions has not been investigated in depth. We evaluated Bayesian DNNs trained with Bernoulli or Gaussian multiplicative masking of either the units (dropout) or the weights (dropconnect). We tested the calibration of the probabilistic predictions of Bayesian convolutional neural networks (CNNs) on MNIST and CIFAR-10. Sampling at prediction time increased the calibration of the DNNs' probabalistic predictions. Sampling weights, whether Gaussian or Bernoulli, led to more robust representation of uncertainty compared to sampling of units. However, using either Gaussian or Bernoulli dropout led to increased test set classification accuracy. Based on these findings we used both Bernoulli dropout and Gaussian dropconnect concurrently, which we show approximates the use of a spike-and-slab variational distribution without increasing the number of learned parameters. We found that spike-and-slab sampling had higher test set performance than Gaussian dropconnect and more robustly represented its uncertainty compared to Bernoulli dropout.
연구 동기 및 목표
- 샘플링 기반 변분 추론 방법을 평가하여 딥 네ural 네트워크에서의 불확실성 표현을 향상시키는 것.
- 이미지 분류 작업에서 다양한 변분 분포—베르누이 및 가우시안 드롭아웃, 드롭컨넥트, 스파이크-앤프레드 근사—의 성능과 강건성 비교하기.
- 베르누이 드롭아웃과 가우시안 드롭컨넥트를 조합하여 스파이크-앤프레드 변분 추론의 파라미터 효율적인 근사법 개발하기.
- 노이즈가 있는 테스트 입력을 통해 이러한 방법의 일반화 성능 평가하기
제안 방법
- 저자는 네트워크 가중치의 사후분포를 근사하기 위해 변분 추론을 사용하며, 변분 분포와 진짜 사후분포 사이의 KL 발산을 최소화한다.
- 다양한 샘플링 전략을 평가한다: 단위(드롭아웃) 또는 가중치(드롭컨넥트)에 적용된 베르누이 및 가우시안 곱셈 노이즈.
- 예측 시점에서 몬테카를로 샘플링을 사용하여 예측 불확실성 추정 및 校정 향상.
- 새로운 방법은 베르누이 드롭아웃과 가우시안 드롭컨넥트를 조합하여 학습된 파라미터 수를 증가시키지 않고 스파이크-앤프레드 변분 분포를 근사한다.
- 모델은 MNIST와 CIFAR-10에서 노이즈가 추가된 테스트 세트를 사용하여 평가되며, 이를 통해 분포 이탈을 시뮬레이션한다.
- 교정 능력은 노이즈 수준에 따라 예측 확률과 실제 레이블 빈도의 평균 제곱오차를 통해 평가된다.
실험 결과
연구 질문
- RQ1예측 시점에서의 샘플링은 분포 이탈 하에서 딥 네럴 네트워크 예측의 교정에 어떤 영향을 미치는가?
- RQ2베르누이와 가우시안, 드롭아웃과 드롭컨넥트를 비교할 때, 다양한 변분 분포는 불확실성 표현과 테스트 정확도 측면에서 어떻게 다른가?
- RQ3베르누이 드롭아웃과 가우시안 드롭컨넥트를 조합하여 파라미터 수 증가 없이 스파이크-앤프레드 변분 분포를 효과적으로 근사할 수 있는가?
- RQ4드롭아웃 비율과 노이즈 분산의 선택은 노이즈가 있는 입력 하에서 베이지안 DNN의 강건성과 성능에 어떤 영향을 미치는가?
주요 결과
- 예측 시점에서의 샘플링은 모든 모델에서 분포 이탈 하에서도 예측의 교정을 일관되게 향상시켰다.
- 가우시안 드롭컨넥트는 CIFAR-10에서 가장 높은 테스트 정확도를 달성했지만, 베르누이 드롭아웃보다 입력 노이즈에 덜 강건했다.
- 베르누이 드롭아웃과 스파이크-앤프레드 드롭아웃은 입력 노이즈에 더 강건했으며, 고분산 변형에서도 교정 능력을 유지했다.
- 제안된 베르누이 드롭아웃과 가우시안 드롭컨넥트의 조합은 스파이크-앤프레드 분포를 효과적으로 근사했으며, 가우시안 드롭컨넥트보다 높은 테스트 정확도와 베르누이 드롭아웃보다 더 나은 불확실성 교정 능력을 보였다.
- 더 높은 분산을 가진 드롭아웃 스케줄링을 사용한 샘플링은 더 큰 성능 향상을 가져왔으며, 이는 몬테카를로 샘플링이 하이퍼파ram터 선택에 민감도를 감소시킨다는 것을 시사한다.
- CIFAR-10에서 몬테카를로 샘플링은 고분산 드롭아웃 하에서 성능 향상이 더 두드러졌으며, 이는 더 나은 정규화와 안정성을 의미한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.