Skip to main content
QUICK REVIEW

[논문 리뷰] Single Model Uncertainty Estimation via Stochastic Data Centering

Jayaraman J. Thiagarajan, Rushil Anirudh|arXiv (Cornell University)|2022. 07. 14.
Adversarial Robustness in Machine Learning인용 수 9
한 줄 요약

이 논문은 단일 모델 기반의 불확실성 추정 방법인 Delta-UQ를 제안한다. 이 방법은 무작위 상수 보정을 통한 확률적 데이터 중심화를 활용하여 다양한 예측을 생성함으로써 정확한 지식 기반 불확실성 정량화를 가능하게 한다. 학습 시 입력 데이터에 학습 가능한 앵커를 적용한 하나의 네트워크를 사용함으로써, 딥 앙상블 수준의 성능을 달성하면서도 계산 비용이 적고, 이상치 탐지, 분포 이탈에 대한 강건성, 베이지안 최적화 등 다양한 분야에서 효과적이다.

ABSTRACT

We are interested in estimating the uncertainties of deep neural networks, which play an important role in many scientific and engineering problems. In this paper, we present a striking new finding that an ensemble of neural networks with the same weight initialization, trained on datasets that are shifted by a constant bias gives rise to slightly inconsistent trained models, where the differences in predictions are a strong indicator of epistemic uncertainties. Using the neural tangent kernel (NTK), we demonstrate that this phenomena occurs in part because the NTK is not shift-invariant. Since this is achieved via a trivial input transformation, we show that this behavior can therefore be approximated by training a single neural network -- using a technique that we call $Δ-$UQ -- that estimates uncertainty around prediction by marginalizing out the effect of the biases during inference. We show that $Δ-$UQ's uncertainty estimates are superior to many of the current methods on a variety of benchmarks -- outlier rejection, calibration under distribution shift, and sequential design optimization of black box functions. Code for $Δ-$UQ can be accessed at https://github.com/LLNL/DeltaUQ

연구 동기 및 목표

  • 딥 앙상블 수준의 성능를 보이지만 계산 비용이 적은 단일 모델 기반 불확실성 추정 방법을 개발하는 것.
  • 일정한 보정을 통한 무작위 데이터 이동이 지식 기반 불확실성 추정에 필요한 충분한 모델 다양성을 유도할 수 있는지 조사하는 것.
  • 앵커 기반 데이터 변환을 통해 유도된 불확실성은 최소한의 아키텍처 변경으로 단일 신경망을 통해 근사 가능함을 보여주는 것.
  • 분포 이탈, 이상치 탐지, 순차적 블랙박스 최적화와 같은 실제 시나리오에서의 강건성을 검증하는 것.

제안 방법

  • 이 방법은 입력 데이터에 학습 가능한 앵커 벡터 $[\mathbf{c}, \mathbf{x} - \mathbf{c}]$ 를 적용하여 학습하는 단일 딥 신경망을 사용한다. 여기서 $\mathbf{c}$ 는 학습 가능한 보정 벡터이다.
  • 추론 시에는 다양한 앵커 값 $\mathbf{c}$ 를 샘플링하여 다수의 예측을 생성하고, 이 예측들의 표준편차를 불확실성으로 추정한다.
  • 신경 장핵 커널(Ntk)의 이동 불변성 부재가 원인이 되어, 동일한 가중치 초기화 조건에서도 다른 보정 이동이 서로 다른 모델 해를 유도함으로써 이론적 기반을 확보한다.
  • 모든 앙상블 학습을 피하기 위해 앵커 변형에 대한 주변화를 수행함으로써, 단일 모델로 앙상블의 다양성을 효과적으로 근사한다.
  • 학습 목표는 그대로 유지되며, 오직 입력 표현만 앵커를 포함하도록 수정함으로써 기존 모델에 쉽게 통합할 수 있다.
  • 불확실성 추정은 추론 시 $K$개의 샘플된 앵커에 대해 $\sigma = \text{std}(f(\mathbf{x}; \mathbf{\theta}, \mathbf{c}_1), \dots, f(\mathbf{x}; \mathbf{\theta}, \mathbf{c}_K))$ 로 계산된다.

실험 결과

연구 질문

  • RQ1무작위 상수 보정을 통해 입력 데이터에 가해진 이동이 단일 딥 신경망에서 지식 기반 불확실성 추정에 필요한 충분한 모델 다양성을 유도할 수 있는가?
  • RQ2신경 장핵 커널(NTK)의 이동 불변성 부재가 데이터 중심화 하에서 예측 분산의 발생을 설명할 수 있는가?
  • RQ3앵커 기반 입력 변환을 통해 학습된 단일 모델이 딥 앙상블의 불확실성 성능을 근사할 수 있는가?
  • RQ4분포 이탈 조건 하에서 기존의 불확실성 추정 기준 대비 캘리브레이션과 강건성 측면에서 Delta-UQ의 성능은 어떠한가?
  • RQ5제한된 데이터로도 순차적 블랙박스 최적화 과제에서 Delta-UQ가 성능 향상에 기여할 수 있는가?

주요 결과

  • Delta-UQ는 벤치마크 함수에 대한 순차 최적화에서 AUC(ROC 곡선 아래 면적) 측면에서 딥 앙상블, 몬테카를로 드롭아웃, 베이지안 신경망, 가우시안 프로세스를 모두 능가하는 성능을 보였다.
  • 고차원 문제(예: 8차원)에서도 Delta-UQ는 우수한 성능 유지를 보였고, MCD와 DEns는 성능이 심각하게 저하됨을 통해 확장성의 우수성을 입증했다.
  • MNIST에 기반한 GAN 기반 최적화에서, 동일한 샘플링 예산 조건 하에 Delta-UQ는 모든 기준 대비 높은 기능 값(이미지 두께)을 달성했다.
  • 손상된 ImageNet 및 CIFAR-10 데이터셋에서 Delta-UQ는 기존 방법들보다 분포 이탈 조건 하에서 뛰어난 校정성(캘리브레이션)을 보였다.
  • 최소한의 학습 오버헤드로 ImageNet과 CIFAR-10에서 경쟁 가능한 정확도를 확보하면서도 의미 있는 불확실성 추정을 제공했다.
  • 절단 분석을 통해 불확실성은 모델 가중치의 랜덤성 때문이 아니라 앵커 기반 데이터 변환에 기인함을 확인하여 핵심 메커니즘의 타당성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.