Skip to main content
QUICK REVIEW

[논문 리뷰] Unlabelled Data Improves Bayesian Uncertainty Calibration under Covariate Shift

Alexander Chan, Ahmed M. Alaa|arXiv (Cornell University)|2020. 06. 26.
Fault Detection and Control Systems인용 수 14
한 줄 요약

이 논문은 공변량 이탈 상황에서 신경망의 베이지안 불확실성 캘리브레이션을 향상시키기 위해 비라벨된 타겟 데이터를 가짜 레이블로 사용하여 사후 분포를 정규화하는 Transductive Dropout를 제안한다. 분포가 이탈된 점들에 대해 더 높은 불확실성을 유도함으로써, 이 방법은 이질적 데이터에 대한 예측에서의 과신을 크게 감소시키며, 다양한 인구 집단에서 전립선암 생존율 예측에서 표준 몬테카를로 드롭아웃보다 뛰어난 성능을 보인다.

ABSTRACT

Modern neural networks have proven to be powerful function approximators, providing state-of-the-art performance in a multitude of applications. They however fall short in their ability to quantify confidence in their predictions - this is crucial in high-stakes applications that involve critical decision-making. Bayesian neural networks (BNNs) aim at solving this problem by placing a prior distribution over the network's parameters, thereby inducing a posterior distribution that encapsulates predictive uncertainty. While existing variants of BNNs based on Monte Carlo dropout produce reliable (albeit approximate) uncertainty estimates over in-distribution data, they tend to exhibit over-confidence in predictions made on target data whose feature distribution differs from the training data, i.e., the covariate shift setup. In this paper, we develop an approximate Bayesian inference scheme based on posterior regularisation, wherein unlabelled target data are used as "pseudo-labels" of model confidence that are used to regularise the model's loss on labelled source data. We show that this approach significantly improves the accuracy of uncertainty quantification on covariate-shifted data sets, with minimal modification to the underlying model architecture. We demonstrate the utility of our method in the context of transferring prognostic models of prostate cancer across globally diverse populations.

연구 동기 및 목표

  • 학습 데이터 분포와 다를 경우(공변량 이탈 시) 베이지안 신경망 예측에서의 과신 문제를 해결하기 위해.
  • 오류가 심각한 결과를 초래할 수 있는 고위험 응용 분야, 예를 들어 의료 예후에서의 불확실성 정량화를 향상시키기 위해.
  • 타겟 도메인의 라벨 데이터가 필요 없이 비라벨된 타겟 데이터를 활용하여 불확실성 추정을 개선하는 방법을 개발하기 위해.
  • 실제 세계의 의료 예측 과제, 특히 분포가 다른 전 세계 인구 집단 간의 분야에서 비라벨된 데이터를 활용한 사후 정규화의 효과를 입증하기 위해.

제안 방법

  • 이 방법은 비라벨된 타겟 데이터를 '가짜 레이블'로 사용하여 사후 정규화 기법을 도입함으로써, 특히 분포가 이탈된 점들에서의 과신을 방지하기 위한 정규화 항을 제안한다.
  • 모델이 타겟 데이터에 대해 더 높은 예측 분산을 출력하도록 유도하는 정규화 항을 수식화하여, 분포 이탈에 의한 불확실성을 반영한다.
  • 이 방법은 몬테카를로 드롭아웃 프레임워크(MCDP) 내부에 구현되며, 변분 추론 목표에 전이적 정규화 손실을 추가한다.
  • 정규화 손실은 소스 데이터와 타겟 데이터에 대한 모델의 예측 분산을 비교하여 계산되며, 내부 및 외부 분포 점들 간의 불확실성 차이를 유도한다.
  • 이 방법은 전이적 설정에서 적용되며, 학습 중에 소스 라벨 데이터와 타겟 비라벨 데이터를 모두 사용하여 일반화 및 불확실성 캘리브레이션을 향상시킨다.
  • 이 프레임워크는 몬테카를로 드롭아웃 외의 다른 베이지안 신경망 추론 기법에도 일반적으로 적용 가능하다.

실험 결과

연구 질문

  • RQ1비라벨된 타겟 데이터가 공변량 이탈 상황에서 베이지안 신경망의 불확실성 캘리브레이션 향상에 효과적으로 사용될 수 있는가?
  • RQ2타겟 데이터를 모델 신뢰도의 가짜 레이블로 활용함으로써, 기존의 베이지안 방법에 비해 더 신뢰할 수 있는 불확실성 추정이 가능할까?
  • RQ3실제 의료 응용 분야에서 상당한 도메인 이탈이 발생하는 상황, 예를 들어 다양한 인구 집단 간의 전립선암 생존율 예측에서 이 방법은 어떻게 성능을 보이는가?
  • RQ4모델의 불확실성은 실제로 분포가 이탈된 데이터에서의 예측 오차와 어느 정도 관련이 있는가?
  • RQ5학습 데이터에 포함되지 않은 고위험 환자 하위 집단(예: 고령이면서 PSA 수치가 높은 환자)에서 과신을 줄일 수 있는가?

주요 결과

  • Transductive Dropout는 공변량 이탈된 데이터에서 불확실성 캘리브레이션을 크게 향상시켜, 표준 몬테카를로 드롭아웃 대비 과신을 감소시켰다.
  • 이 방법은 전 세계적으로 다양한 인구 집단에서 전립선암 생존율 예측에서 베이지안 및 빈도주의 기반 기준 모델을 모두 능가했다.
  • Transductive Dropout가 높은 불확실성을 예측한 환자들은 50% 위험 기준선을 적용했을 때 치료 대상으로 적절히 식별될 가능성이 더 높았으며, 신뢰구간이 임상 의사결정을 향상시켰다.
  • 모델은 고령이면서 PSA 수치가 높은 환자들(학습 데이터에 적게 포함된 하위 집단)에서 더 높은 불확실성을 보였으며, 이는 도메인 지식과 일치하며 적절한 캘리브레이션을 나타냈다.
  • 잘못 분류된 케이스는 주로 평균 연령 74세, 평균 PSA 수치 28.6인 고령 집단에서 발생했으며, 이는 분포가 이탈된 점들이 정확히 모델이 더 불확실해야 할 부분임을 확인했다.
  • 타겟 도메인의 추가 라벨 데이터가 필요 없이도 비라벨 데이터를 신뢰도의 가짜 레이블로 활용함으로써 불확실성 추정이 향상되었으며, 이는 자료가 부족한 환경에서 실용적인 유용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.