Skip to main content
QUICK REVIEW

[논문 리뷰] Local Calibration: Metrics and Recalibration

Rachel Luo, Aadyot Bhatnagar|arXiv (Cornell University)|2021. 02. 22.
Machine Learning and Data Classification인용 수 5
한 줄 요약

이 논문은 사전 학습된 특징 공간 내에서 커널 기반 유사도와 신뢰도 박스 분할을 사용하여 국소적 근처에서 예측 신뢰도를 측정하는 국소 校정 오차(LCE)라는 지표를 소개한다. 또한 LCE를 감소시키는 후처리 校정 방법인 LoRe를 제안하며, 사전에 그룹 정보를 알지 못한 채 이미지 및 테이블 분류 작업에서 공정성과 의사결정을 향상시키며, 전역 校정 방법보다 후속 작업에서 뛰어난 성능을 발휘한다.

ABSTRACT

Probabilistic classifiers output confidence scores along with their predictions, and these confidence scores should be calibrated, i.e., they should reflect the reliability of the prediction. Confidence scores that minimize standard metrics such as the expected calibration error (ECE) accurately measure the reliability on average across the entire population. However, it is in general impossible to measure the reliability of an individual prediction. In this work, we propose the local calibration error (LCE) to span the gap between average and individual reliability. For each individual prediction, the LCE measures the average reliability of a set of similar predictions, where similarity is quantified by a kernel function on a pretrained feature space and by a binning scheme over predicted model confidences. We show theoretically that the LCE can be estimated sample-efficiently from data, and empirically find that it reveals miscalibration modes that are more fine-grained than the ECE can detect. Our key result is a novel local recalibration method LoRe, to improve confidence scores for individual predictions and decrease the LCE. Experimentally, we show that our recalibration method produces more accurate confidence scores, which improves downstream fairness and decision making on classification tasks with both image and tabular data.

연구 동기 및 목표

  • 단일 관측치 제약으로 인해 개별 예측 校정이 이룩될 수 없음에도 불구하고, 전역 校정 지표(예: ECE)와 이상적인 개별 예측 校정 간 격차를 해소하기 위함.
  • 특징 공간 내 유사한 샘플에 대한 오차를 집계하여 개별 예측 수준에서 신뢰도를 추정할 수 있는 校정 지표를 개발하기 위함.
  • 모델 재학습이나 민감 그룹에 대한 사전 지식이 필요 없이 국소 校정 오차(LCE)를 감소시키는 후처리 校정 방법을 설계하기 위함.
  • LCE를 최소화하면 특히 저신뢰도 예측에 대해 '안전한' 조치를 취할 수 있는 경우에 공정성 및 의사결정 작업에서 성능 향상이 이루어짐을 입증하기 위함.

제안 방법

  • LCE는 사전 학습된 특징 공간 내에서 커널 함수를 통해 정의된 유사도와 신뢰도 박스 분할을 사용하여 유사한 샘플의 이웃에서 평균 校정 오차를 측정함으로써 계산된다.
  • 이웃의 크기는 대역폭 파라미터 γ로 제어되며, 이는 큰 γ일 경우 전역(전역)에서 작은 γ일 경우 개별(개별) 校정으로의 보간을 가능하게 한다.
  • LoRe는 비모수적이고 후처리적인 校정 방법으로, 국소 이웃 통계 기반으로 예측을 재가중하여 LCE를 최소화하도록 신뢰도 점수를 조정한다.
  • 유사도는 사전 학습된 백본(예: ResNet)의 특징에 대한 가우시안 커널을 사용하여 측정되며, 명시적 그룹 레이블 없이 국소 일반화를 가능하게 한다.
  • 이론적 분석을 통해 커널이 유계일 경우 LCE는 다항 수준의 표본 복잡도로 추정 가능하므로 신뢰할 수 있는 경험적 추정이 가능하다.
  • 재학습 없이 적용 가능하므로 어떤 사전 학습된 모델과도 호환되며, 실세계 시스템에 쉽게 구현할 수 있다.

실험 결과

연구 질문

  • RQ1개별 예측 수준에서의 신뢰도를 측정할 수 있는 지표를 설계할 수 있는가? 단, 개별 오분류 확률 추정이 불가능한 상황에서도 가능할까?
  • RQ2ECE와 같은 전역 지표가 감지하지 못하는 국소적 校정 오차 패턴을 LCE와 같은 국소적 校정 지표가 드러내는가?
  • RQ3모델 재학습이나 사전 지식 없이도 후처리 校정 방법이 LCE를 감소시킬 수 있는가? 전역 校정 성능은 손상되지 않는가?
  • RQ4국소 校정을 향상시키면 민감 그룹 정보가 校정 시에 알려지지 않은 상황에서도 공정성 결과가 향상되는가?
  • RQ5저신뢰도 예측에 대해 '안전한' 조치가 가능한 환경에서 LCE가 낮아지면 의사결정 성능이 향상되는가?

주요 결과

  • LoRe는 공정성 벤치마크에서 재교정 없이 대비해 최대 그룹별 MCE를 평균 50% 감소시키며, 다음으로 성능이 좋은 전역 방법보다 24% 향상되었다.
  • LoRe는 다양한 대역폭 파라미터 γ에 걸쳐 MLCE 감소에서 전역 재교정 방법을 모두 능가했으며, t-SNE 및 PCA 특징 공간 모두에서 일관된 성과를 보였다.
  • 최대 그룹별 MCE는 ECE와 같은 전역 지표보다 MLCE와 더 강하게 상관되어 있어, LCE가 공정성과 관련된 오교정을 더 잘 반영함을 시사한다.
  • ImageNet 의사결정 작업에서 LoRe는 보상 비율 w/u가 다양한 범위에서 총 보상을 가장 높게 기록했으며, 모든 베이스라인을 압도했다.
  • LoRe는 강력한 전역 校정 성능도 유지하여 ImageNet에서 모든 방법 중 가장 낮은 ECE(0.007), NLL(0.955), Brier 점수(40.58)를 기록했다.
  • LoRe는 저신뢰도 예측 시 '안전한' 조치를 더 정확하게 선택할 수 있도록 하여 시스템 유틸리티를 직접적으로 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.