Skip to main content
QUICK REVIEW

[논문 리뷰] Calibrating Deep Neural Network Classifiers on Out-of-Distribution Datasets

Zhihui Shao, Jianyi Yang|arXiv (Cornell University)|2020. 06. 16.
Adversarial Robustness in Machine Learning참고 문헌 39인용 수 4
한 줄 요약

이 논문은 외부 분포(out-of-distribution, OOD) 데이터셋에서 깊이 신경망 분류기의 신뢰도 추정을 향상시키기 위해 잘못 분류된 샘플을 정확한 예측과 분리하기 위해 보조 클래스를 도입하는 후처리 校정 방법인 CCAC(Confidence Calibration with an Auxiliary Class)를 제안한다. 이는 OOD 데이터에서의 과신뢰도를 크게 감소시킨다. CCAC는 이미지 및 텍스트 분류 작업 전반에서 기존 방법보다 기대 캘리브레이션 오차(Expected Calibration Error, ECE)와 브리어 스코어(Brier Score)에서 일관되게 뛰어난 성능을 보이며, 간소화된 변형(CCAC-S)을 통해 새로운 OOD 데이터셋으로의 효율적 전이가 가능하다.

ABSTRACT

To increase the trustworthiness of deep neural network (DNN) classifiers, an accurate prediction confidence that represents the true likelihood of correctness is crucial. Towards this end, many post-hoc calibration methods have been proposed to leverage a lightweight model to map the target DNN's output layer into a calibrated confidence. Nonetheless, on an out-of-distribution (OOD) dataset in practice, the target DNN can often mis-classify samples with a high confidence, creating significant challenges for the existing calibration methods to produce an accurate confidence. In this paper, we propose a new post-hoc confidence calibration method, called CCAC (Confidence Calibration with an Auxiliary Class), for DNN classifiers on OOD datasets. The key novelty of CCAC is an auxiliary class in the calibration model which separates mis-classified samples from correctly classified ones, thus effectively mitigating the target DNN's being confidently wrong. We also propose a simplified version of CCAC to reduce free parameters and facilitate transfer to a new unseen dataset. Our experiments on different DNN models, datasets and applications show that CCAC can consistently outperform the prior post-hoc calibration methods.

연구 동기 및 목표

  • 외부 분포(OOD) 테스트 데이터에 배포된 깊이 신경망 분류기에서 과신뢰도 예측 문제를 해결하기 위해.
  • OOD 오분류를 고려하는 후처리 방법을 사용해 모델 출력을 캘리브레이션함으로써 예측 신뢰도의 신뢰성을 향상시키기 위해.
  • 학습 분포와 테스트 데이터 분포가 크게 이질적일 경우에도 효과적인 캘리브레이션 방법을 개발하기 위해.
  • 최소한의 레이블된 데이터로 새로운 미사용 OOD 데이터셋에 캘리브레이션 모델을 효율적으로 전이하기 위해.
  • 자유 매개변수 수를 줄이면서도 OOD 데이터에서 높은 성능을 유지하는 캘리브레이션 모델을 개발하기 위해.

제안 방법

  • CCAC는 신뢰도 추정 과정에서 잘못 분류된 예측과 정확한 예측을 분리하기 위해 캘리브레이션 헤드에 보조 클래스를 도입한다.
  • 이 방법은 목표 DNN의 로짓 출력을 입력으로 사용하는 경량 2층 신경망을 사용하며, 19개 클래스의 소프트맥스 출력(원래 18개 클래스 + 1개 오분류 클래스)을 생성한다.
  • 간소화된 변형인 CCAC-S는 정확한 클래스 로짓에 대해 단일 온도 스케일링 매개변수를 사용하고, 오분류 클래스에 대해 작은 신경망을 사용함으로써 매개변수를 감소시킨다.
  • 캘리브레이션 모델은 검증 세트에서 교차 엔트로피와 캘리브레이션 목표를 균형 있게 조정하기 위한 하이퍼파라미터 λ₁ 및 λ₂를 사용하는 하이브리드 손실 함수로 훈련된다.
  • 전이 가능성은 새로운 데이터셋의 소량의 레이블된 OOD 샘플을 사용해 CCAC-S를 미세조정함으로써 달성되며, 전체 모델을 재학습하지 않고도 적응이 가능하다.
  • 신뢰도 캘리브레이션 평가는 표준 지표인 기대 캘리브레이션 오차(Expected Calibration Error, ECE), 브리어 스코어(Brier Score, BS), AUROC, AUPR, 및 p.9(정확한 예측에 대한 신뢰도)를 사용해 평가된다.

실험 결과

연구 질문

  • RQ1후처리 캘리브레이션 방법이 외부 분포 테스트 데이터에 적용되었을 때 깊이 신경망 분류기의 과신뢰도를 효과적으로 줄일 수 있는가?
  • RQ2잘못 분류된 샘플을 나타내는 보조 클래스를 도입함으로써 OOD 데이터에서 예측 신뢰도의 신뢰성이 향상되는가?
  • RQ3간소화된 캘리브레이션 모델(CCAC-S)이 자유 매개변수 수를 줄이면서도 뛰어난 일반화 및 전이 가능성을 유지할 수 있는가?
  • RQ4소량의 레이블된 데이터로 CCAC 방법이 새로운 미사용 OOD 데이터셋에 얼마나 잘 전이되는가?
  • RQ5CCAC가 다양한 OOD 데이터셋에서 ECE와 브리어 스코어 측면에서 기존 후처리 캘리브레이션 방법을 일관되게 능가하는가?

주요 결과

  • 20 Newsgroups OOD 데이터셋에서 CCAC는 기대 캘리브레이션 오차(ECE)를 3.9%로 감소시켜 다음으로 우수한 베이스라인인 Dirichlet(8.6%)을 크게 능가했다.
  • CCAC-S는 OOD 데이터셋에서 ECE를 3.0%로 기록하여, 매개변수 수가 적은 간소화된 모델이 여전히 최첨단 캘리브레이션 성능을 달성할 수 있음을 보여주었다.
  • OOD 데이터셋에서 CCAC는 AUROC를 0.861로 향상시키고 AUPR를 0.894로 높여, 온도 스케일링(auROC: 0.855, AUPR: 0.917)을 포함한 모든 베이스라인을 능가했다.
  • 전이된 모델인 CCAC-T는 뿌리기 위한 레이블된 샘플 320개만으로 OOD 데이터셋에서 ECE를 4.7%로 달성하여, 극히 소량의 데이터로도 강력한 전이 가능성을 보였다.
  • 신뢰도 다이어그램과 신뢰도 히스토GRAM은 CCAC가 잘 캘리브레이션된 신뢰도 점수를 생성하며, 정확한 예측은 고신뢰도에 집중되어 있고, 잘못 분류된 샘플은 명확히 분리되어 낮은 신뢰도가 부여됨을 보여주었다.
  • 내부 분포(D1) 데이터셋에서 CCAC는 ECE 2.4%와 브리어 스코어 0.125를 기록하여 내부 분포 데이터에서도 뛰어난 성능을 보였으며, 모든 베이스라인보다 일관된 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.