Skip to main content
QUICK REVIEW

[논문 리뷰] Stationary Activations for Uncertainty Calibration in Deep Learning

Lassi Meronen, Christabella Irwanto|arXiv (Cornell University)|2020. 10. 19.
Anomaly Detection Techniques and Applications참고 문헌 50인용 수 7
한 줄 요약

이 논문은 가우스 프로세스의 매트른 커널 가족에서 유도된 비선형 신경망 활성화 함수인 매트른 활성화 함수를 소개한다. 무한한 너비의 네트워크에서 이러한 활성화 함수를 GP 사전분포와 연결함으로써, 특히 분포 외부(OOD) 입력에 대해 더 나은 불확실성 캘리브레이션을 달성한다. 특히 매트른-5/2 활성화 함수는 표준 ReLU 및 RBF 활성화 함수에 비해 더 뛰어난 OOD 불확실성 분리 성능을 보였다.

ABSTRACT

We introduce a new family of non-linear neural network activation functions that mimic the properties induced by the widely-used Matérn family of kernels in Gaussian process (GP) models. This class spans a range of locally stationary models of various degrees of mean-square differentiability. We show an explicit link to the corresponding GP models in the case that the network consists of one infinitely wide hidden layer. In the limit of infinite smoothness the Matérn family results in the RBF kernel, and in this case we recover RBF activations. Matérn activation functions result in similar appealing properties to their counterparts in GP models, and we demonstrate that the local stationarity property together with limited mean-square differentiability shows both good performance and uncertainty calibration in Bayesian deep learning tasks. In particular, local stationarity helps calibrate out-of-distribution (OOD) uncertainty. We demonstrate these properties on classification and regression benchmarks and a radar emitter classification task.

연구 동기 및 목표

  • 특히 분포 외부(OOD) 입력에 대해 불확실성 캘리브레이션 부족 문제를 해결한다.
  • 구조화된 활성화 함수를 통한 사전 지식 통합을 통해 베이지안 딥 러닝 모델의 해석 가능성과 신뢰도를 향상시킨다.
  • 매트른 커널 가족에서 유도된 새로운 활성화 함수를 통해 가우스 프로세스 사전분포와 신경망 활성화 함수 간 격차를 메운다.
  • 활동 함수의 국소적 정상성과 제한된 이차모멘트 미분 가능성은 더 나은 OOD 불확실성 추정에 기여함을 보여준다.
  • 잘 이해된 GP 커널 성질에 기반하여 표준 ReLU 및 RBF 활성화 함수의 체계적인 대안을 제공한다.

제안 방법

  • 무한한 너비의 신경망에서 사용되는 커널-활성화 함수 사상의 역행을 통해 새로운 비선형 활성화 함수 가족을 유도한다.
  • 매트른 커널의 매개변수(부드러움 ν 및 길이 척도 ℓ)를 직접 활성화 함수의 매개변수로 매핑하여 GP 사전분포와의 일치를 확보한다.
  • 매트른 활성화 함수를 사용한 단일층, 무한히 넓은 신경망이 매트른 프로세스를 거친 GP와 명시적인 등가성을 가지도록 한다.
  • 몬테카를로 드롭아웃을 사용해 근사 베이지안 추론을 수행함으로써, 복잡한 변분 추론 없이도 불확실성 정량화를 가능하게 한다.
  • 표준 순방향 신경망을 매트른-ν/2 활성화 함수(ν = 1.5, 2.5, 4.5)로 훈련하고, ReLU, RBF, ERF, 스텝 활성화 함수와의 성능 및 불확실성 캘리브레이션을 비교한다.
  • 예측 분산 히스토GRAM 및 알려진 클래스와 알려지지 않은 클래스의 고/저분산 테스트 샘플에 대한 시각적 점검을 통해 불확실성 수준을 평가한다.

실험 결과

연구 질문

  • RQ1잘 알려진 GP 커널에서 유도된 매트른 활성화 함수는 딥 뉴럴 네트워크의 불확실성 캘리브레이션을 향상시킬 수 있는가?
  • RQ2매트른 활성화 함수의 국소적 정상성은 표준 ReLU 또는 RBF 활성화 함수에 비해 분포 외부(OOD) 불확실성 추정에 어떤 영향을 미치는가?
  • RQ3활성화 함수의 제한된 이차모멘트 미분 가능성은 더 나은 일반화 및 불확실성 정량화에 기여하는가?
  • RQ4매트른 가족의 부드러움 매개변수 ν의 선택은 OOD 탐지 작업에서 불확실성 캘리브레이션과 모델 성능에 어떤 영향을 미치는가?
  • RQ5제안된 활성화 함수는 기존 활성화 함수보다 알려진 클래스와 알려지지 않은 클래스의 불확실성 간 분리를 더 잘 달성할 수 있는가?

주요 결과

  • 매트른-5/2 활성화 함수는 CIFAR-10 OOD 벤치마크에서 알려진 클래스에서의 높은 불확실성과 알려지지 않은 클래스에서의 낮은 불확실성 간 분리를 뚜렷이 향상시켰다.
  • 매트른-3/2 활성화 함수는 더 직관적인 불확실성 패턴을 생성하였으며, 알려진 클래스 입력에서는 높은 불확실성, 알려지지 않은 클래스 입력에서는 낮은 불확실성으로 나타났다.
  • 지수형(매트른-1/2) 활성화 함수는 알려진 클래스와 알려지지 않은 클래스 모두에서 높은 분산을 유지하여 OOD 불확실성 분리가 빈약했다.
  • ReLU 및 스텝 활성화 함수는 임의의 불확실성 패턴을 보였으며, 잘못된 분류가 아닌 알려지지 않은 샘플에서도 높은 분산을 보여 불확실성 캘리브레이션이 열악함을 시사했다.
  • ERF 및 RBF 활성화 함수는 중간 정도의 OOD 불확실성 분리를 보였지만, 매트른-5/2 및 매트른-3/2에 비해 직관적이고 일관된 불확실성 캘리브레이션에서 뒤져 있었다.
  • 매트른-5/2 활성화 함수는 성능과 불확실성 캘리브레이션 사이의 최적의 균형을 달성하였으며, 알려진 클래스에서는 높은 신뢰도, 알려지지 않은 클래스에서는 높은 불확실성 수준을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.