Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Calibration with Multi-domain Temperature Scaling

Yaodong Yu, Stephen Bates|arXiv (Cornell University)|2022. 06. 06.
Anomaly Detection Techniques and Applications인용 수 6
한 줄 요약

이 논문은 다양한 데이터 분포 간의 보정을 향상시키기 위해 도메인별 온도 파rameter를 학습하는 다중 도메인 온도 스케일링을 제안한다. 여러 도메인 간 이질성을 활용함으로써, 표준 온도 스케일링에 비해 분포 내 및 분포 외 도메인 모두에서 유의미하게 향상된 보정 성능를 달성하며, 세 가지 벤치마크 데이터셋에서 실증적으로 확인된 성과 향상이 있다.

ABSTRACT

Uncertainty quantification is essential for the reliable deployment of machine learning models to high-stakes application domains. Uncertainty quantification is all the more challenging when training distribution and test distribution are different, even the distribution shifts are mild. Despite the ubiquity of distribution shifts in real-world applications, existing uncertainty quantification approaches mainly study the in-distribution setting where the train and test distributions are the same. In this paper, we develop a systematic calibration model to handle distribution shifts by leveraging data from multiple domains. Our proposed method -- multi-domain temperature scaling -- uses the heterogeneity in the domains to improve calibration robustness under distribution shift. Through experiments on three benchmark data sets, we find our proposed method outperforms existing methods as measured on both in-distribution and out-of-distribution test sets.

연구 동기 및 목표

  • 학습 데이터와 테스트 데이터의 분포가 다를 때 발생하는 모델 보정의 핵심 과제를 해결한다.
  • 기존의 보정 방법, 예를 들어 온도 스케일링은 병합된 데이터에서는 잘 작동하지만, 개별 분포 외 도메인에 적용했을 땐 실패한다는 점을 인지한다.
  • 관측된 모든 도메인에서 신뢰할 수 있는 불확실성 추정을 보장하고, 향후 관측되지 않은 도메인으로의 일반화를 보장하는 체계적인 보정 프레임워크를 개발한다.
  • 모델이 서로 다른 데이터 분포를 가진 다수의 도메인에서 학습된 상황에서, 강건한 보정이 가능한지에 대한 이론적 및 실증적 조사를 수행한다.

제안 방법

  • 각 입력에 대해 도메인별 온도 파rameter를 학습하는 단일 온도 스케일링의 일반화인 다중 도메인 온도 스케일링을 제안한다.
  • 입력 특징을 온도 값으로 매핑하기 위해 신경망 또는 함수 근사기(함수 근사기)를 사용하여 각 도메인에 맞는 적응형 보정을 가능하게 한다.
  • 모든 도메인의 검증 데이터를 사용하여 보정 헤드를 훈련하며, 도메인 간 기대 보정 오차(Expected Calibration Error, ECE)를 최소화한다.
  • 이 방법은 분포 내 도메인들의 혼합 분포를 암묵적으로 학습하며, 이는 분포 외 도메인으로의 일반화 추정을 위한 대체 기준이 된다.
  • H-분산과 가짜 차원(pseudo-dimension)을 사용하여 이론적으로 방법을 분석하며, 분포 내 도메인에서의 양호한 성능가 분포 외 도메인으로의 일반화 가능성과 관련된 이론적 근거를 제시한다.
  • H-분산을 최소화하도록 분포 혼합 가중치 α를 최적화하여, 강건성 향상을 도모한다.

실험 결과

연구 질문

  • RQ1다양한 도메인의 데이터 구조를 활용함으로써 분포 이탈 상황에서의 모델 보정을 향상시킬 수 있는가?
  • RQ2모든 관측된 도메인에서의 보정을 요구하는 것이 향후 관측되지 않은 도메인으로의 일반화를 향상시키는가?
  • RQ3왜 다중 도메인 보정이 분포 이탈에 대해 강건한지를 이론적으로 설명할 수 있는가?
  • RQ4분포 내 및 분포 외 데이터에서 다중 도메인 온도 스케일링과 표준 온도 스케일링 간의 보정 오차는 어떻게 비교되는가?
  • RQ5H-분산 프레임워크 하에서 분포 내 도메인들의 혼합이 분포 외 도메인으로의 일반화를 위한 대체 기준으로 기능할 수 있는가?

주요 결과

  • 세 가지 벤치마크 데이터셋에서 다중 도메인 온도 스케일링은 분포 내 및 분포 외 테스트 세트에서 표준 온도 스케일링보다 유의미하게 뛰어난 성능을 보였다.
  • ImageNet-C에서, 이 방법은 병합된 데이터 온도 스케일링이 개별 오염 도메인에서 보정에 실패하는 것과는 달리, 개별 오염 도메인에서 기대 보정 오차(Expected Calibration Error, ECE)가 상당히 낮게 유지되었다.
  • 이 방법은 관측되지 않은 도메인에서도 잘 보정된 신뢰도 추정을 유지하며, 분포 이탈 상황에서의 일반화 능력 향상을 시사한다.
  • 이론적 분석 결과, 만약 모델이 모든 분포 내 도메인에서 잘 보정되어 있고, 혼합 분포가 H-분산 기준으로 분포 외 분포와 유사하다면, 향후 관측되지 않은 도메인으로의 일반화가 가능할 것임을 확인하였다.
  • 실증 결과는, 평균 성능 뿐 아니라 각 도메인에서의 성능도 잘 달성하도록 훈련할 경우 보정의 강건성이 향상됨을 확인하였다.
  • 제안된 방법은 분포 내 및 분포 외 보정 간 격차를 줄여, 이전 방법의 핵심 한계를 해결하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.