Skip to main content
QUICK REVIEW

[논문 리뷰] On Calibrated Model Uncertainty in Deep Learning

Biraja Ghoshal, Allan Tucker|arXiv (Cornell University)|2022. 06. 15.
Anomaly Detection Techniques and Applications인용 수 6
한 줄 요약

이 논문은 의료 진단에 특화된 딥러닝에서 모델의 불확실성 캘리브레이션을 향상시키기 위해 드롭웨이트를 사용한 손실 캘리브레이션 베이지안 신경망을 제안한다. 사후 분포에 대한 기대 효용을 최대화함으로써, 특히 코로나19 흉부 엑스레이 검출에서 잘못된 음성 결과(거짓 음성)가 줄어들며 높은 정확도를 유지하면서도 1.91의 최대 불확실성 캘리브레이션 오차(MUCE)를 달성하여 표준 모델보다 뚜렷이 뛰어난 성능을 보였다.

ABSTRACT

Estimated uncertainty by approximate posteriors in Bayesian neural networks are prone to miscalibration, which leads to overconfident predictions in critical tasks that have a clear asymmetric cost or significant losses. Here, we extend the approximate inference for the loss-calibrated Bayesian framework to dropweights based Bayesian neural networks by maximising expected utility over a model posterior to calibrate uncertainty in deep learning. Furthermore, we show that decisions informed by loss-calibrated uncertainty can improve diagnostic performance to a greater extent than straightforward alternatives. We propose Maximum Uncertainty Calibration Error (MUCE) as a metric to measure calibrated confidence, in addition to its prediction especially for high-risk applications, where the goal is to minimise the worst-case deviation between error and estimated uncertainty. In experiments, we show the correlation between error in prediction and estimated uncertainty by interpreting Wasserstein distance as the accuracy of prediction. We evaluated the effectiveness of our approach to detecting Covid-19 from X-Ray images. Experimental results show that our method reduces miscalibration considerably, without impacting the models accuracy and improves reliability of computer-based diagnostics.

연구 동기 및 목표

  • 의료 진단과 같이 고위험 응용 분야에서 예측 오차와 실제 추정 불확실성 간의 불일치가 발생하는 베이지안 신경망의 캘리브레이션 오류를 해결하기 위해.
  • 특히 질병 검출에서 비용이 큰 거짓 음성 결과를 최소화하는 태스크 특화 비대칭 효용 함수를 통합하여 딥러닝의 의사결정 신뢰도를 향상시키기 위해.
  • 모델 정확도를 유지하면서도 예측에 대한 과신을 줄이는 캘리브레이션된 불확실성 추정 방법을 개발하기 위해.
  • 실제 의료 영상, 특히 흉부 엑스레이 영상에서의 코로나19 검출을 위한 고위험 예측 과제에서 손실 캘리브레이션된 불확실성의 효과를 평가하기 위해.
  • 고위험 예측 과제에서 보다 신뢰할 수 있는 신뢰도를 측정하기 위해 최대 불확실성 캘리브레이션 오차(MUCE)라는 새로운 지표를 도입하고 검증하기 위해.

제안 방법

  • 손실 캘리브레이션된 베이지안 프레임워크의 근사 추론을 드롭웨이트 기반의 베이지안 신경망으로 확장하여, 효용 기반 사후 근사에 기반한 불확실성 캘리브레이션을 가능하게 한다.
  • 태스크 특화 효용 함수를 통합하여 표준 증거 하한 경계(ELBO) 손실에 새로운 페널티 항을 도입함으로써 스트로스틱 최적화를 정규화한다.
  • 몬테카를로 드롭아웃(MC-Dropweights)을 사용하여 네트워크 가중치의 사후 분포를 근사함으로써, 훈련 및 추론 중 모두 불확실성 추정이 가능하게 한다.
  • 2단계 프로세스를 적용: 먼저 사후 분포 $ q(\theta|D) $ 를 근사하고, 그 다음 사후 분포에 대한 기대 효용을 최적화하여 사후 위험을 최소화한다.
  • 예측 오차와 추정 불확실성 간의 상관관계를 측정하기 위해 워샤르스타인 거리를 사용하여 캘리브레이션 오류를 평가한다.
  • 고위험 의사결정을 위한 최악의 경우 편차를 정량화하기 위해 최대 불확실성 캘리브레이션 오차(MUCE)를 지표로 제안한다.

실험 결과

연구 질문

  • RQ1손실 캘리브레이션된 베이지안 신경망에 드롭웨이트를 적용하면, 특히 의료 영상 과제에서 불확실성 캘리브레이션 오류를 줄일 수 있는가?
  • RQ2태스크 특화 효용 함수를 통합하면, 비대칭 오분류 비용이 존재하는 모델에서 불확실성 캘리브레이션과 의사결정의 신뢰도가 어떻게 향상되는가?
  • RQ3제안된 방법은 표준 모델 대비 흉부 엑스레이 영상에서의 코로나19 검출에서 거짓 음성 예측을 얼마나 줄이는가?
  • RQ4제안된 최대 불확실성 캘리브레이션 오차(MUCE) 지표는 실제 예측 오차와 모델의 신뢰도와 얼마나 잘 상관되는가?
  • RQ5손실 캘리브레이션 접근법은 불확실성 캘리브레이션 오류를 뚜렷이 줄이면서도 모델 정확도를 유지하거나 향상시키는가?

주요 결과

  • MC-Dropweights를 사용한 손실 캘리브레이션 BNN은 1.91의 MUCE를 기록하여 표준 BNN(3.77)과 가중치가 부여된 크로스엔트로피 모델(5.42)보다 유의미하게 낮아, 훨씬 뛰어난 불확실성 캘리브레이션 성능을 보였다.
  • 이 방법은 기대 캘리브레이션 오차(ECE)를 7.01로 줄였으며, 표준 BNN의 13.27 대비 개선된 신뢰도 캘리브레이션을 보였다.
  • 손실 캘리브레이션 모델은 정확도를 80.88%까지 향상시켰고, 표준 BNN(70.12%)과 가중치가 부여된 크로스엔트로피 모델(74.09%)을 모두 뛰어넘었다.
  • 워샤르스타인 거리로 측정한 바에 따르면, 추정 불확실성과 예측 오차 사이에 강한 상관관계가 있었으며, 이는 불확실성 캘리브레이션 오류가 감소했음을 시사한다.
  • 신뢰도 다이어그램은 손실 캘리브레이션 모델의 신뢰도와 불확실성 추정치가 실제 정확도와 더 잘 일치함을 확인했으며, 특히 고위험 예측 범주에서 뚜렷하게 향상된 것으로 나타났다.
  • 이 방법은 일반적으로 코로나19 환자를 '정상'으로 잘못 분류하는 문제를 효과적으로 줄였으며, 임상 의사결정 지원에서의 안전성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.