[논문 리뷰] Amortized Conditional Normalized Maximum Likelihood: Reliable Out of Distribution Uncertainty Estimation
이 논문은 분포 이탈 상황에서 딥 네URAL 네트워크의 신뢰할 수 있는 불확실성 추정을 위한 확장 가능한 방법인 암시적 조건부 정규화 최대 우도(ACNML)를 제안한다. 완전한 학습 데이터를 사용한 최소화-최대화 최적의 CNML 분포를 근사하는 데 약간의 베이지안 추론을 사용함으로써, 기존 방법들에 비해 외부 분포 입력에서 더 뛰어난 校정 성능을 달성하면서도 대규모 모델에서도 계산적으로 실현 가능한 성능을 보인다.
While deep neural networks provide good performance for a range of challenging tasks, calibration and uncertainty estimation remain major challenges, especially under distribution shift. In this paper, we propose the amortized conditional normalized maximum likelihood (ACNML) method as a scalable general-purpose approach for uncertainty estimation, calibration, and out-of-distribution robustness with deep networks. Our algorithm builds on the conditional normalized maximum likelihood (CNML) coding scheme, which has minimax optimal properties according to the minimum description length principle, but is computationally intractable to evaluate exactly for all but the simplest of model classes. We propose to use approximate Bayesian inference technqiues to produce a tractable approximation to the CNML distribution. Our approach can be combined with any approximate inference algorithm that provides tractable posterior densities over model parameters. We demonstrate that ACNML compares favorably to a number of prior techniques for uncertainty estimation in terms of calibration on out-of-distribution inputs.
연구 동기 및 목표
- 딥 러닝에서 신뢰할 수 있는 불확실성 추정, 특히 분포 이탈 상황에서의 핵심 과제를 해결하기 위해.
- 조건부 정규화 최대 우도(CNML) 프레임워크의 이론적 최소-최대 최적성 특성을 유지하면서도 실용적인 방법을 개발하기 위해.
- 약간의 베이지안 추론을 사용해 계산이 불가능한 CNML 계산을 암시적으로 근사함으로써 딥 네트워크에서 확장 가능한 불확실성 추정을 가능하게 하기 위해.
- 외부 분포 입력에서의 모델 校정 성능을 향상시켜 잘못된 예측에서의 과신을 줄이기 위해.
제안 방법
- ACNML은 전체 학습 데이터를 모델 파라미터에 대한 근사 사후분포로 대체함으로써 계산이 불가능한 CNML 예측 분포를 근사한다.
- 효율적인 추론을 가능하게 하기 위해, SWAG나 KFAC-Laplace와 같은 계산 가능한 사후분포를 사용하여 불확실성을 표현한다.
- 각 테스트 입력에 대해, ACNML은 레이블별로 조건화된 모델 업데이트를 정규화하여 예측 분포를 계산한다. 여기서 각 모델은 테스트 입력과 근사 사후분포에 조건화되어 있다.
- 최소 기술 길이(MDL) 원리를 활용하여, 과신을 방지하는 코딩 체계를 통해 최소-최대 손실 최적의 행동을 보장한다.
- 모델 파라미터에 대한 계산 가능한 사후 밀도를 제공하는 약간의 베이지안 추론 방법이라면 어떤 것이라도 ACNML과 호환된다.
- 각 테스트 입력에 대해 모델 재학습의 비용을 암시적으로 근사함으로써, 전역적인 CNML 분포 근사 모델을 학습함으로써 비용을 효율화한다.
실험 결과
연구 질문
- RQ1계산 가능한 CNML 분포 근사가 기존의 베이지안 및 비-베이지안 방법들보다 외부 분포 입력에서 더 나은 불확실성 校정 성능을 제공할 수 있는가?
- RQ2분포 이탈의 심각도가 증가함에 따라 ACNML의 校정 성능과 신뢰성은 어떻게 변화하는가?
- RQ3약간의 베이지안 추론을 효과적으로 활용하여 CNML의 계산 비용을 암시적으로 줄일 수 있으며, 이로 인해 이론적 보장은 유지되는가?
- RQ4일반적인 CNML과 표준 딥 러닝 추론에 비해 ACNML의 추론 속도와 정확도는 어떻게 비교되는가?
주요 결과
- MAP, SWA, SWAG-D, KFAC-Laplace에 비해 ACNML은 OOD 입력에서 유의미하게 더 나은 校정 성능을 보이며, 더 보수적이고 신뢰할 수 있는 신뢰도 추정을 제공한다.
- 심각한 손상 상황에서 ACNML 버전은 경쟁 방법들보다 유의미하게 낮은 기대 校정 오차(ECE)와 더 나은 브라이어 스코어를 달성한다.
- 일반적인 CNML에 비해 ACNML은 2개 이상의 지수 차수 빠르며(예: MNIST MLP에서 0.08초 대비 13.83초), 실질적인 구현에 적합하다.
- 더 보수적인 경향이 있음에도 불구하고, ACNML은 내부 분포 CIFAR-10 테스트 세트에서 경쟁력 있는 정확도와 브라이어 스코어를 유지하며 과신하는 기준 모델들을 능가한다.
- 클래스 수에 따라 선형적으로 증가하지만 데이터셋 크기와는 독립적이므로, 대규모 모델에서 효율적인 추론이 가능하다.
- ACNML의 신뢰도 추정은 OOD 입력에서 낮은 신뢰도를 신뢰성 있게 나타내어 고위험 응용 분야에서 안전한 기피 전략을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.