Skip to main content
QUICK REVIEW

[논문 리뷰] A Consistent and Differentiable Lp Canonical Calibration Error Estimator

Teodora Popordanoska, Raphael Sayer|arXiv (Cornell University)|2022. 10. 13.
Adversarial Robustness in Machine Learning인용 수 9
한 줄 요약

이 논문은 다중분류 확률 분류기에서 $L_p$ 표준 캘리브레이션 오차를 일관되고 미분 가능하며 다루기 쉬운 추정기로 제안한다. 딜레르트 핵밀도 추정을 사용하며, 이는 渐近 일관성과 $ olimits^2$ 복잡도 및 $ olimits^{-1/2}$ 수렴 속도를 달성하여 효율적인 미니배치 학습과 정규화를 가능하게 하며, 전체 분포 캘리브레이션에서 기존 추정기보다 일관성과 확장성 면에서 뛰어나다.

ABSTRACT

Calibrated probabilistic classifiers are models whose predicted probabilities can directly be interpreted as uncertainty estimates. It has been shown recently that deep neural networks are poorly calibrated and tend to output overconfident predictions. As a remedy, we propose a low-bias, trainable calibration error estimator based on Dirichlet kernel density estimates, which asymptotically converges to the true $L_p$ calibration error. This novel estimator enables us to tackle the strongest notion of multiclass calibration, called canonical (or distribution) calibration, while other common calibration methods are tractable only for top-label and marginal calibration. The computational complexity of our estimator is $\mathcal{O}(n^2)$, the convergence rate is $\mathcal{O}(n^{-1/2})$, and it is unbiased up to $\mathcal{O}(n^{-2})$, achieved by a geometric series debiasing scheme. In practice, this means that the estimator can be applied to small subsets of data, enabling efficient estimation and mini-batch updates. The proposed method has a natural choice of kernel, and can be used to generate consistent estimates of other quantities based on conditional expectation, such as the sharpness of a probabilistic classifier. Empirical results validate the correctness of our estimator, and demonstrate its utility in canonical calibration error estimation and calibration error regularized risk minimization.

연구 동기 및 목표

  • 다중분류 설정에서 표준(분포) 캘리브레이션을 위한 일관되고, 미분 가능하며 확장 가능한 추정기의 부족을 해결하기 위해.
  • 구간 기반 추정기(일관성 없음), MMCE(일관성 없음), Mix-n-Match(고차원에서 다루기 어려움)와 같은 기존 방법의 한계를 극복하기 위해.
  • 미분 가능하고 일관된 손실을 제공함으로써 캘리브레이션 오차 정규화를 통한 엔드 투 엔드 학습을 가능하게 하기 위해.
  • 유한 표본 성능을 향상시키기 위해 $\mathcal{O}(n^{-2})$로 편향을 감소시키는 기하급수 기반의 편향 보정 기법을 개발하기 위해.
  • 다양한 아키텍처와 데이터셋에서 캘리브레이션 정규화된 리스크 최소화에 추정기의 유용성을 입증하기 위해.

제안 방법

  • 확률 단체 영역에 적합한 자연스러운 핵함수를 사용한 딜레르트 핵밀도 추정(KDE)을 적용하여 조건부 클래스 확률의 정확한 밀도 추정을 가능하게 한다.
  • 유한 표본 정확도를 향상시키기 위해 기하급수 기반의 편향 보정 기법을 도입하여 편향을 $\mathcal{O}(n^{-1})$ 에서 $\mathcal{O}(n^{-2})$ 로 감소시킨다.
  • 단체 위에서 예측된 조건부 확률과 진짜 조건부 확률의 차이에 대한 $L_p$ 노름을 통합하여, 미분 가능한 $L_p$ 표준 캘리브레이션 오차 추정기를 유도한다.
  • 공정한 평가를 위해 비교 시에 이탈한 관측치 최대우도 추정을 사용한 대역폭 선택과 두안의 공식을 사용한 구간 설정을 적용한다.
  • 추정기의 미분 가능성 덕분에 미니배치 업데이트를 가능하게 하여 캘리브레이션 정규화 학습에서 확률적 최적화를 지원한다.
  • 조건부 기대값 기반 공식을 사용하여 날카움 등 관련 양을 추정하는 데도 프레임워크를 확장한다.

실험 결과

연구 질문

  • RQ1고차원 확률 단체에 대해 스케일링 가능한 일관되고 미분 가능한 $L_p$ 표준 캘리브레이션 오차 추정기를 구성할 수 있는가?
  • RQ2기존의 표준 구간 기반 추정기인 $ECE^{bin}$과 비교해 볼 때, 제안된 KDE 기반 추정기는 편향과 수렴 속도 면에서 어떻게 다른가?
  • RQ3기하급수 기반의 편향 보정 기법은 캘리브레이션 오차 추정기의 유한 표본 성능을 어느 정도 향상시키는가?
  • RQ4캘리브레이션 정규화된 리스크 최소화에 이 추정기를 효과적으로 사용할 수 있는가? 이는 정확도를 희생시키지 않고 모델의 캘리브레이션을 향상시키는가?
  • RQ5이 추정기는 다양한 딥러닝 아키텍처와 다중분류 데이터셋에서 안정적이고 신뢰할 수 있는가?

주요 결과

  • 제안된 $ECE^{KDE}$ 추정기는 渐近 일관성과 $ olimits^{-1/2}$ 수렴 속도를 달성하여 이론적 기대와 일치한다.
  • 이 추정기는 $ECE^{bin}$과 유사한 편향과 수렴 행동를 보이지만, 추가로 미분 가능성과 고차원으로의 확장성이라는 장점을 지닌다.
  • 기하급수 기반의 편향 보정 기법은 편향을 $\mathcal{O}(n^{-2})$ 로 감소시켜, 특히 유한 표본에서의 정확도를 크게 향상시킨다.
  • 실험 결과로 $ECE^{KDE}$는 CIFAR-10과 CIFAR-100을 포함한 여러 데이터셋에서 일관된 추정을 제공하며, 다양한 표본 크기에서도 안정된 성능을 보였다.
  • 캘리브레이션 정규화 학습에서 이 방법은 모델의 캘리브레이션을 향상시켰다 (예: ResNet-110에서 CIFAR-100에서 $ECE$를 12.769에서 8.969로 감소), 동시에 높은 정확도를 유지했다.
  • 이 추정기는 효과적인 미니배치 업데이트를 가능하게 하여 딥러닝 파ip라인에서 엔드 투 엔드 학습에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.