Skip to main content
QUICK REVIEW

[논문 리뷰] Sampling-based Bayesian Inference with gradient uncertainty

Chanwoo Park, Jae Myung Kim|arXiv (Cornell University)|2018. 12. 08.
Adversarial Robustness in Machine Learning참고 문헌 16인용 수 8
한 줄 요약

이 논문은 미니배치 내의 확률적 경사하강법 간 내적의 합으로 측정된 경사 불확실성을 사용하여 국소 최적점에 수렴했음을 감지하고, 이를 계기로 매개변수 샘플링을 유도하는 새로운 샘플링 기반 베이지안 추론 방법을 제안한다. 이 방법은 내분포 및 외분포 설정 모두에서 예측 불확실성 추정을 향상시켜, SGLD 및 드롭아웃 기반 방법보다 MNIST 및 notMNIST 벤치마크에서 뛰어난 성능을 보인다.

ABSTRACT

Deep neural networks(NNs) have achieved impressive performance, often exceed human performance on many computer vision tasks. However, one of the most challenging issues that still remains is that NNs are overconfident in their predictions, which can be very harmful when this arises in safety critical applications. In this paper, we show that predictive uncertainty can be efficiently estimated when we incorporate the concept of gradients uncertainty into posterior sampling. The proposed method is tested on two different datasets, MNIST for in-distribution confusing examples and notMNIST for out-of-distribution data. We show that our method is able to efficiently represent predictive uncertainty on both datasets.

연구 동기 및 목표

  • 의료 진단 및 자율 주행과 같은 안전이 중요한 애플리케이션에서 특히 중요한 딥 네URAL 네트워크의 과신 예측 문제를 해결한다.
  • 샘플링 기반 베이지안 추론에 경사 불확실성을 통합하여 예측 불확실성 추정을 향상시킨다.
  • 경사가 국소 최적점 근처에 있을 때만 사전 분포 샘플링을 유도하는 계산적으로 효율적인 방법을 개발한다.
  • 실제 벤치마크 데이터셋에서 SGLD 및 드롭아웃 기반 베이지안 근사 방법과 비교해 내분포(MNIST) 및 외분포(notMNIST) 데이터 모두에서 뛰어난 불확실성 정량화 성능을 입증한다.

제안 방법

  • 미니배치 내 모든 확률적 경사하강법 간 내적의 합으로 경사 불확실성을 정의한다: $\sum_{i \neq j} \langle X_i, X_j \rangle$, 여기서 $X_i = \nabla_\theta J(\theta; x^{(i)}, y^{(i)})$.
  • 이 경사 불확실성을 사용하여 모델이 국소 최적점에 도달했음을 감지하는 신호로 활용한다. 이는 경사에 존재하는 평균이 0인 가우시안 노이즈로 인해 낮은 값으로 나타남을 의미한다.
  • 경사 불확실성이 사전 정의된 임계값 이하로 떨어질 때만 매개변수 샘플링을 실행하여 국소 최소 근처에서만 샘플링이 이루어지도록 보장한다.
  • 국소 모드를 벗어나 매개변수 공간을 탐색하기 위해 샘플링 단계 동안에만 적응형 노이즈 주입을 적용한 확률적 경사 하강 랭그비안 동역학(SGLD)을 적용한다.
  • 경사 불확실성이 높을 땐 표준 SGD 업데이트를 유지하여 불필요한 샘플링을 방지하고 학습 효율성을 유지한다.
  • 불확실성 지표(예: 엔트로피)를 계산하기 위해 몬테카를로 샘플링을 60개의 샘플을 통해 후행 예측 분포를 근사한다.

실험 결과

연구 질문

  • RQ1확률적 최적화 과정에서 경사 불확실성이 국소 최적점 수렴 감지를 위한 신뢰할 수 있는 신호로 사용될 수 있는가?
  • RQ2샘플링 기반 베이지안 추론에 경사 불확실성을 통합하면, 모호한 내분포 예제에서 예측 불확실성 추정이 향상되는가?
  • RQ3제안된 방법은 기준 방법과 비교해 외분포 입력을 효과적으로 식별하고 낮은 신뢰도를 할당하는가?
  • RQ4실제 세계 벤치마크 데이터셋에서 SGLD 및 드롭아웃 기반 베이지안 근사 방법과 비교해 제안된 방법의 불확실성 추정 품질은 어떠한가?

주요 결과

  • 제안된 방법은 혼동스러운 MNIST 숫자(예: 4, 5, 7)에 대해 다양하고 잘 校정된 예측 출력을 생성하며, 확률이 타당한 오분류에 집중된다. 이는 과신하는 기준 방법과 대비된다.
  • notMNIST 외분포 데이터에서는 메서드가 더 평탄한 예측 사후 분포를 생성하여 더 신뢰할 수 있는 불확실성 추정을 나타낸다.
  • 외분포 데이터에서의 예측 엔트로피는 제안된 방법에서 1.355로, SGLD(0.107) 및 드롭아웃(0.665)보다 유의미하게 높아 과신이 감소했음을 확인한다.
  • 내분포 MNIST 데이터에서의 테스트 정확도는 제안된 방법이 98.05%를 기록하여 SGLD(95.34%)를 초월했으며, 강력한 불확실성 캘리브레이션을 유지했다.
  • 경사 불확실성은 국소 최적점 근처 영역을 효과적으로 식별하여 전체 데이터 계산이나 수락 단계 없이도 타겟팅된 샘플링을 가능하게 한다.
  • 경사 불확실성은 매 반복마다 전체 배치 계산을 피하기 위해 미니배치 범위에서만 계산되기 때문에 계산적으로 효율적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.