Skip to main content
QUICK REVIEW

[논문 리뷰] Calibration of Neural Networks using Splines

Kartik Gupta, Amir Rahimi|arXiv (Cornell University)|2020. 06. 23.
Adversarial Robustness in Machine Learning참고 문헌 30인용 수 4
한 줄 요약

이 논문은 콜모고로프-스미르노프(Kolmogorov-Smirnov, KS) 검정에서 유도된 스퍼링으로 맞춘 누적분포함수를 사용하여 신경망에 대한 밴딩(free) 校정 방법을 제안한다. 보류된 校정 데이터 세트에서 경험적 누적분포를 미분 가능한 스퍼링으로 근사화함으로써, 학습되지 않은 직접적인 校정 함수를 학습하여 원래의 네트워크 출력을 잘 校정된 확률로 매핑한다. 이 방법은 여러 데이터셋과 아키텍처에서 일관되게 1% 미만의 KS 오차를 달성하며, 최신의 사후 校정 기법들을 능가한다.

ABSTRACT

Calibrating neural networks is of utmost importance when employing them in safety-critical applications where the downstream decision making depends on the predicted probabilities. Measuring calibration error amounts to comparing two empirical distributions. In this work, we introduce a binning-free calibration measure inspired by the classical Kolmogorov-Smirnov (KS) statistical test in which the main idea is to compare the respective cumulative probability distributions. From this, by approximating the empirical cumulative distribution using a differentiable function via splines, we obtain a recalibration function, which maps the network outputs to actual (calibrated) class assignment probabilities. The spine-fitting is performed using a held-out calibration set and the obtained recalibration function is evaluated on an unseen test set. We tested our method against existing calibration approaches on various image classification datasets and our spline-based recalibration approach consistently outperforms existing methods on KS error as well as other commonly used calibration measures. Our Code is available at https://github.com/kartikgupta-at-anu/spline-calibration.

연구 동기 및 목표

  • 기대 校정 오차(Expected Calibration Error, ECE)와 같은 히스토그램 기반 校정 지표의 한계를 해결하기 위해, 임의의 밴딩 스킴에 의존하는 문제를 해결한다.
  • 클래스별 또는 상위-r 예측의 校정을 측정하기 위해 콜모고로프-스미르노프(Kolmogorov-Smirnov, KS) 검정에 영감을 받은 밴딩(free), 시각화 友好的한 校정 지표를 개발한다.
  • 보류된 校정 데이터 세트에서 스퍼링 피팅을 사용하여 학습되지 않은, 미분 가능한 재보정 함수를 설계하여 원래의 네트워크 출력을 잘 校정된 확률로 매핑한다.
  • 다양한 이미지 분류 데이터셋과 아키텍처에서 이 방법을 평가하여 기존의 사후 校정 기법들에 비해 일관되게 뛰어난 성능을 보임을 입증한다.
  • 모델의 원래 정확도를 유지하면서도 상위-1 및 상위-2 예측에서 校정 오차를 크게 감소시킨다.

제안 방법

  • 경험적 누적분포함수를 비교함으로써 KS 검정에 기반한 밴딩(free) 校정 지표를 제안한다. 이는 예측된 클래스 확률과 진짜 클래스 확률의 경험적 누적분포함수를 비교한다.
  • 자연스러운 큇브 스퍼링(natural cubic splines)을 사용하여 네트워크 출력의 경험적 누적분포함수를 근사화함으로써, 미분 가능하고 부드러운 재보정을 가능하게 한다.
  • 보류된 校정 데이터 세트에서 스퍼링을 피팅하여 원래의 로그릿(logits)을 校정된 확률로 매핑하는 재보정 함수를 학습한다. 이 과정에서 모델 파rameter를 업데이트하지 않는다.
  • 학습된 재보정 함수를 사용하여 테스트 데이터에 대해 校정 성능을 평가하며, KS 오차 및 기타 표준 지표를 사용한다.
  • 모든 실험에서 스퍼링 피팅에 대해 고정된 6개의 커프(knots)를 사용하여 일관되고 안정적인 校정을 보장한다.
  • 공개 레포지토리에서 제공하는 사전 훈련된 네트워크의 로그릿(logits)을 사용하여 방법을 평가하며, 校정 과정에서 원래 모델의 정확도를 유지한다.

실험 결과

연구 질문

  • RQ1KS 검정에 기반한 밴딩(free) 校정 지표는 ECE와 같은 히스토그램 기반 지표보다 더 견고하고 일관된 신경망 校정 측정을 제공할 수 있는가?
  • RQ2경험적 누적분포함수의 스퍼링 피팅을 통해 학습되지 않은, 미분 가능한 재보정 함수를 얻을 수 있으며, 이는 재학습 없이도 校정 성능을 향상시킬 수 있는가?
  • RQ3제안된 스퍼링 기반 재보정 방법은 ImageNet과 같은 다양한 데이터셋과 아키텍처에서 온전한 사후 校정 기법들인 온도 스케일링과 딜로이트 校정과 비교해 어떻게 성능을 내는가?
  • RQ4이 방법은 대규모 데이터셋인 ImageNet과 같은 경우에 높은 분류 정확도를 유지하면서 거의 완벽한 校정을 달성할 수 있는가?
  • RQ5이 방법은 상위-1뿐만 아니라 상위-2 및 상위-3 예측까지 효과적으로 校정할 수 있으며, 다양한 예측 순위에서의 강건성을 확보할 수 있는가?

주요 결과

  • 제안된 스퍼링 기반 재보정 방법은 평가된 모든 데이터셋과 모델에서 1% 미만의 KS 오차를 달성하며, 유일한 예외로 하나의 케이스에서 0.7%에 도달한다.
  • 이 방법은 온도 스케일링, 벡터 스케일링, ODIR를 사용한 매트릭스 스케일링, 딜로이트 校정 등과 비교해 KS 오차 측면에서 일관되게 뛰어난 성능을 보이며, 특히 대규모 ImageNet에서 두각을 나타낸다.
  • 13개 실험 중 9개에서 온도 스케일링(가장 가까운 경쟁자)보다 낮은 KS 오차를 기록했으며, 일부 경우에서 오차 차이가 0.3% 미만으로 미미하다.
  • 상위-2 예측 校정의 경우, 모든 실험에서 校정 오차가 1% 이하로 유지되며, ImageNet에서 새로운 최고 기록을 수립한다.
  • 이 방법은 모든 테스트 케이스에서 원래 모델의 분류 정확도를 유지한다. 이는 네트워크 파rameter를 미세조정하거나 업데이트하지 않기 때문이다.
  • KS 기반의 校정 지표는 신뢰도 다이어그램과 유사한 효과적인 시각화를 제공하며, ECE에 내재된 밴딩 스킴 의존성 문제를 제거한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.