Skip to main content
QUICK REVIEW

[논문 리뷰] Nonparametric Uncertainty Quantification for Single Deterministic Neural Network

Nikita Kotelevskii, Aleksandr Artemenkov|arXiv (Cornell University)|2022. 02. 07.
Machine Learning and Data Classification인용 수 8
한 줄 요약

이 논문은 단일 결정론적 신경망에서의 불확실성 추정을 위한 빠르고 확장 가능한 방법인 비모수적 불확실성 정량화(NUQ)를 제안한다. 잠재 표현에서의 Nadaraya-Watson 커널 스무딩을 활용하여 조건부 레이블 분포를 추정함으로써 NUQ는 당연한 분리 기반의 이종 불확실성과 경험 불확실성을 분리 제공하며, ImageNet, MNIST 및 GLUE 데이터셋을 포함한 이미지 및 텍스트 벤치마크에서 MaxProb 및 DDU와 같은 기준선보다 뛰어난 성능을 보인다. 특히 데이터가 적은 환경에서 성능이 뛰어나다.

ABSTRACT

This paper proposes a fast and scalable method for uncertainty quantification of machine learning models' predictions. First, we show the principled way to measure the uncertainty of predictions for a classifier based on Nadaraya-Watson's nonparametric estimate of the conditional label distribution. Importantly, the proposed approach allows to disentangle explicitly aleatoric and epistemic uncertainties. The resulting method works directly in the feature space. However, one can apply it to any neural network by considering an embedding of the data induced by the network. We demonstrate the strong performance of the method in uncertainty estimation tasks on text classification problems and a variety of real-world image datasets, such as MNIST, SVHN, CIFAR-100 and several versions of ImageNet.

연구 동기 및 목표

  • 단일 결정론적 신경망을 위한 원칙적이고 확장 가능한 불확실성 정량화 방법의 부족을 해결한다.
  • 강한 가정(예: 잠재 공간 내 정규성)에 의존하거나 높은 계산 비용을 유발하는 기존 접근법의 한계를 극복한다.
  • 모델 불확실성이 가장 중요한 경우가 되는 자원이 제한된 환경에서 신뢰할 수 있는 불확실성 추정을 가능하게 한다.
  • 앙상블이나 베이지안 추론을 요구하지 않고도 이종 불확실성과 경험 불확실성을 분리하는 통합 프레임워크를 제공한다.
  • 어떤 훈련된 네트워크의 특징 공간에서 직접 작동하므로 다양한 딥러닝 모델에 적용 가능하도록 보장한다.

제안 방법

  • 조건부 레이블 분포의 Nadaraya-Watson 추정기를 기반으로 한 점별 베이즈 위험(잘못된 예측의 확률)으로 불확실성을 수식화한다.
  • 훈련 잠재 표현을 사용하여 임의의 테스트 점에서의 클래스 확률에 대한 커널 기반 비모수적 추정을 수행한다.
  • Nadaraya-Watson 추정기의 渐近 정규 근사를 적용하여 베이즈 위험의 상한을 유도하고, 이로써 총 불확실성 추정치를 제공한다.
  • 위험 상한을 데이터 모호성(이종 불확실성)과 모델 불확실성(경험 불확실성) 항목으로 분해하여 총 불확실성을 분리한다.
  • 확장성을 확보하기 위해 근사 근접 이웃을 사용하여 효율적으로 구현하며, ImageNet과 같은 대규모 데이터셋에 적용 가능하다.
  • 모든 신경망에 적용하기 위해 학습된 특징 표현을 커널 기반 불확실성 추정의 입력으로 사용한다.

실험 결과

연구 질문

  • RQ1잠재 공간에서의 커널 스무딩 기반 비모수적 방법이 앙상블이나 베이지안 추론 없이 신뢰할 수 있는 불확실성 추정을 제공할 수 있는가?
  • RQ2제안된 방법이 기존 기준선 대비 이종 불확실성과 경험 불확실성을 얼마나 잘 분리하는가?
  • RQ3분포 가정이 실패하기 쉬운 데이터가 적은 환경에서도 이 방법이 강력한 성능을 유지하는가?
  • RQ4ImageNet-O 및 ImageNet-R와 같은 표준 벤치마크에서 최첨단의 OOD 탐지 성능을 달성할 수 있는가?
  • RQ5ImageNet과 같은 대규모 데이터셋에 대해 이 방법은 어떻게 확장되며, 앙상블나 몬테카를로 방법 대비 계산 효율성은 어떠한가?

주요 결과

  • NUQ는 앙상블을 사용하여 ImageNet-O에서 ROC-AUC 59.1점, ImageNet-R에서 76.1점의 성능을 기록하며 MaxProb 및 기타 기준선을 초월한다.
  • Two Moons 토이 데이터셋에서, NUQ는 단지 200개의 훈련 포인트만으로도 모호한 영역에서 높은 불확실성을 정확히 식별하는 반면, DDU는 이러한 불확실성을 탐지하지 못한다.
  • ELECTRA 기반 모델을 사용한 GLUE 벤치마크에서의 텍스트 분류 작업에서 NUQ는 ROSTD에서 최대 0.995, CLINC에서 0.979의 정확도를 기록하며 최첨단 성능을 달성한다.
  • 이 방법은 자원이 제한된 환경에서도 강건성을 보이며, 정규성 가정에 의존하는 방법과 달리 훈련 데이터가 부족한 상황에서도 높은 불확실성 추정 품질을 유지한다.
  • NUQ의 불확실성 분리 기능은 모호한 내부 분포 샘플(높은 이종 불확실성)과 외부 분포 샘플(높은 경험 불확실성)을 식별할 수 있게 하여 더 나은 액티브 러닝 및 인간-자동 결합 의사결정을 가능하게 한다.
  • 이 방법은 ImageNet과 같은 대규모 데이터셋으로도 효율적으로 확장되며, 계산 비용이 추론 시간과 유사하여 실세계 구현에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.