Skip to main content
QUICK REVIEW

[논문 리뷰] Soft Calibration Objectives for Neural Networks

Archit Karandikar, Nicholas Cain|arXiv (Cornell University)|2021. 07. 30.
Adversarial Robustness in Machine Learning참고 문헌 31인용 수 8
한 줄 요약

이 논문은 예측 불확실성 캘리브레이션을 향상시키기 위해 미분 가능하고 소프트-빈 기반의 캘리브레이션 목표함수—SB-ECE 및 S-AvUC—을 제안한다. 이는 신경망의 엔드 투 엔드 훈련을 가능하게 하며, 이산적 빈(bin) 대신 연속적이고 겹치는 빈을 사용함으로써 최신 기술 수준의 기대 캘리브레이션 오차(Expected Calibration Error, ECE)를 달성하면서도 정확도가 1% 미만으로 떨어지며, 분포 이탈(distribution shift) 상황에서도 표준 교차 엔트로피 훈련과 후행 보정(post-hoc) 방법들(예: 온도 스케일링)보다 뛰어나다.

ABSTRACT

Optimal decision making requires that classifiers produce uncertainty estimates consistent with their empirical accuracy. However, deep neural networks are often under- or over-confident in their predictions. Consequently, methods have been developed to improve the calibration of their predictive uncertainty both during training and post-hoc. In this work, we propose differentiable losses to improve calibration based on a soft (continuous) version of the binning operation underlying popular calibration-error estimators. When incorporated into training, these soft calibration losses achieve state-of-the-art single-model ECE across multiple datasets with less than 1% decrease in accuracy. For instance, we observe an 82% reduction in ECE (70% relative to the post-hoc rescaled ECE) in exchange for a 0.7% relative decrease in accuracy relative to the cross entropy baseline on CIFAR-100. When incorporated post-training, the soft-binning-based calibration error objective improves upon temperature scaling, a popular recalibration method. Overall, experiments across losses and datasets demonstrate that using calibration-sensitive procedures yield better uncertainty estimates under dataset shift than the standard practice of using a cross entropy loss and post-hoc recalibration methods.

연구 동기 및 목표

  • 높은 정확도에도 불구하고 과신 또는 과소신 예측을 내는 딥 신경망의 열악한 캘리브레이션 문제를 해결하기 위해.
  • 표준 캘리브레이션 오차 추정기(예: ECE)가 이산적 빈(bin)으로 인해 비미분 가능하기 때문에 기울기 기반 최적화가 불가능한 문제를 해결하기 위해.
  • 하드 빈(bin)의 대체로, 연속적이고 미분 가능한 방법을 개발하여 캘리브레이션 오차 추정을 가능하게 하고, 훈련 중 직접 최적화 및 후행 보정(post-hoc recalibration)을 가능하게 하기 위해.
  • 표준 교차 엔트로피 손실 이후 후행 보정 방법을 사용하는 것 대신, 캘리브레이션 민감한 훈련 목표함수를 사용하여 분포 이탈 하에서 불확실성 추정을 향상시키기 위해.
  • 소프트 캘리브레이션 목표함수가 기존 방법보다 인-디스트리뷰션(in-distribution) 및 아웃-오브-디스트리뷰션(out-of-distribution) 설정 모두에서 불확실성 추정의 일반화 성능을 더 잘 향상시킨다는 것을 입증하기 위해.

제안 방법

  • 신뢰도 점수를 가우시안 등 다양한 미분 가능한 커널 함수를 사용해 겹치는 연속적 빈으로 매핑하는 소프트-빈 기반 메커니즘을 제안하며, 이는 이산적이고 하드한 빈(bin)을 대체한다.
  • 연속적 빈을 기반으로 기대 캘리브레이션 오차(Expected Calibration Error, ECE)의 소프트 버전인 SB-ECE를 정의하며, 이는 기대 신뢰도와 정확도를 연속적 빈에 대한 가중 적분으로 계산하여 기울기 계산이 가능하도록 한다.
  • 비베이지안 신경망에서 캘리브레이션을 향상시키기 위해 AvUC 손실의 소프트 변형인 S-AvUC를 도입한다.
  • 인터리브드 훈련(interleaved training)을 사용하여 주 훈련 손실(예: 교차 엔트로피)이 기억화(memorization)를 유도하더라도 소프트 캘리브레이션 목표함수를 적용함으로써 정확도를 유지하면서도 ECE를 낮춘다.
  • 후행 보정(post-hoc recalibration)에서 소프트 캘리브레이션 목표함수를 주 손실로 사용하여 SB-ECE를 직접 최적화하고 온도 파라미터를 최적화하는 TS-SB-ECE를 적용한다.
  • ECE 계산을 위해 등질량 빈(bin)과 ℓ₂ 노름을 사용하며, 다양한 주 손실과 데이터 이탈 조건 하에서 CIFAR-10, CIFAR-100, ImageNet에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1미분 가능하고 연속적인 빈(bin) 기반의 빈 매핑 방식이 신경망 훈련 중 캘리브레이션 오차 최적화에 개선을 이끌 수 있는가?
  • RQ2SB-ECE 및 S-AvUC와 같은 소프트 캘리브레이션 목표함수를 보조 손실로 사용할 경우, 전통적인 캘리브레이션 유도 손실 대비 기대 캘리브레이션 오차(ECE) 감소에 얼마나 효과적인가?
  • RQ3후행 보정에서 소프트 캘리브레이션 오차를 최적화하는 방식(예: TS-SB-ECE)이 표준 온도 스케일링보다 성능이 뛰어나게 되는가?
  • RQ4표준 교차 엔트로피 훈련과 후행 보정 방법 대비 소프트 캘리브레이션 목표함수가 데이터 분포 이탈 상황에서 일반화 성능이 더 뛰어나게 되는가?
  • RQ5소프트 캘리브레이션 목표함수는 다중 클래스 설정에서 상위 레이블 및 마진널(marginal) 캘리브레이션 오차를 동시에 향상시킬 수 있는가?

주요 결과

  • S-AvUC 보조 손실은 다양한 데이터셋과 주 손실에 걸쳐 ECE 향상 폭이 가장 크며, Cohen’s d 효과 크기로 볼 때 매우 큰 향상 수준을 보인다.
  • CIFAR-100에서 이 방법은 ECE를 82% 감소시켰고, 후행 보정된 ECE 대비 70%의 상대적 감소를 기록했으며, 교차 엔트로피 기준선 대비 정확도 손실은 0.7%에 불과하다.
  • TS-SB-ECE는 후행 보정에서 소프트 캘리브레이션 오차를 최적화하는 방법으로, 다양한 데이터셋과 캘리브레이션 오차 측정 기준에서 표준 온도 스케일링을 항상 능가한다.
  • 소프트 캘리브레이션 목표함수는 표준 교차 엔트로피 훈련과 후행 보정 방법 대비 분포 이탈 상황에서 더 뛰어난 일반화 성능을 보인다.
  • 교차 엔트로피로 훈련할 경우 100%의 훈련 정확도로 인해 기억화가 발생하더라도, 인터리브드 훈련을 통해 소프트 캘리브레이션 목표함수로 테스트 ECE를 낮출 수 있다.
  • CIFAR-10, CIFAR-100, ImageNet에서 단일 모델의 ECE를 최신 기술 수준으로 향상시키며, 정확도 저하가 1% 미만으로 유지되어 균형 효율성이 매우 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.