Skip to main content
QUICK REVIEW

[논문 리뷰] Distance-Based Learning from Errors for Confidence Calibration

Xing Chen, Sercan Ö. Arık|arXiv (Cornell University)|2019. 12. 03.
Machine Learning and Algorithms참고 문헌 29인용 수 12
한 줄 요약

이 논문은 거리 기반 오류 학습(DBLE)을 제안하며, 이는 오직 잘못 분류된 샘플을 사용하여 신뢰도 모델을 공동으로 훈련하고, 거리 기반 표현 공간을 학습하는 새로운 훈련 방법이다. DBLE는 앙상블보다 낮은 계산 비용을 가지면서도 단일 모델로 최신 기술 수준의 신뢰도 캘리브레이션 성능을 달성한다.

ABSTRACT

Deep neural networks (DNNs) are poorly calibrated when trained in conventional ways. To improve confidence calibration of DNNs, we propose a novel training method, distance-based learning from errors (DBLE). DBLE bases its confidence estimation on distances in the representation space. In DBLE, we first adapt prototypical learning to train classification models. It yields a representation space where the distance between a test sample and its ground truth class center can calibrate the model's classification performance. At inference, however, these distances are not available due to the lack of ground truth labels. To circumvent this by inferring the distance for every test sample, we propose to train a confidence model jointly with the classification model. We integrate this into training by merely learning from mis-classified training samples, which we show to be highly beneficial for effective learning. On multiple datasets and DNN architectures, we demonstrate that DBLE outperforms alternative single-model confidence calibration approaches. DBLE also achieves comparable performance with computationally-expensive ensemble approaches with lower computational cost and lower number of parameters.

연구 동기 및 목표

  • 표준 크로스 엔트로피 손실로 훈련된 딥 네ural 네트워크의 낮은 신뢰도 캘리브레이션 문제를 해결하기 위해.
  • 후처리 캘리브레이션 또는 앙상블 방법에 의존하지 않고 잘 캘리브레이션된 신뢰도 추정을 가능하게 하는 훈련 방법을 개발하기 위해.
  • 표현 공간 내의 거리를 활용하고 잘못 분류된 샘플에서 학습하여 캘리브레이션을 향상시키기 위해.
  • 기존 방법들과 비교해 계산 오버헤드를 최소화하면서 높은 캘리브레이션 성능를 달성하기 위해.

제안 방법

  • DBLE는 테스트 샘플이 진짜 클래스 중심까지의 거리가 모델 성능과 상관관계를 가지는 거리 기반 표현 공간에서 분류 모델을 훈련하기 위해 프로토타입 학습을 변형한다.
  • 추론 시 진짜 레이블이 가용하지 않기 때문에, 분류 모델과 함께 함께 훈련된 별도의 신뢰도 모델을 사용하여 진짜 클래스 중심까지의 거리를 추정한다.
  • 신뢰도 모델은 오직 잘못 분류된 훈련 샘플에서만 훈련되며, 잘못된 예측에 대해 추정된 거리가 최대가 되도록 하는 손실 함수를 사용한다.
  • 훈련 단계당 두 번의 순방향 전파를 사용한다: 하나는 분류 모델을 위한 것이고, 다른 하나는 신뢰도 모델을 위한 것이다. 신뢰도 모델은 오직 오류 발생 시에만 업데이트된다.
  • 신뢰도 모델은 작은 MLP로 구현되며, 주 모델의 파라미터 수의 1~3%만 추가한다.
  • 표준 최적화를 사용하며 학습률 스케줄링을 적용하고, 신뢰도 모델은 추정된 거리에 대해 음의 로그우도 목적함수를 사용하여 업데이트된다.

실험 결과

연구 질문

  • RQ1거리 기반 표현 공간은 딥 네럴 네트워크의 신뢰도 캘리브레이션을 향상시킬 수 있는가?
  • RQ2잘못 분류된 샘플에서 학습함으로써 계산 비용을 증가시키지 않고도 신뢰도 모델 성능을 향상시킬 수 있는가?
  • RQ3공동으로 훈련된 신뢰도 모델은 더 많은 파라미터와 더 긴 훈련 시간을 요구하는 딥 앙상블 수준의 캘리브레이션 성능를 달성할 수 있는가?
  • RQ4DBLE는 후처리 캘리브레이션 및 베이지안 딥 러닝 방법과 비교해 캘리브레이션 성능와 추론 효율성 측면에서 어떻게 성능을 내는가?

주요 결과

  • ResNet50를 사용한 CIFAR-100에서 DBLE는 기대 캘리브레이션 오차(ECE) 3.6%를 달성하여, 베이직 훈련(25.2%)과 다른 기준들을 크게 능가한다.
  • Tiny-ImageNet에서 DBLE는 기존 훈련 방식의 ECE 25.2%를 3.6%로 감소시켜 다양한 데이터셋에서 일관된 성능 향상을 보였다.
  • VGG11를 사용한 CIFAR-100에서 DBLE는 ECE 1.1%를 기록하여 MC-dropout 및 온도 스케일링을 능가했으며, 딥 앙상블의 성능에 근접했다.
  • CIFAR-100-VGG11에서 DBLE의 훈련 시간은 베이직 훈련의 1.4배이며, CIFAR-100-ResNet50에서는 1.7배이지만, 네 개의 네트워크로 구성된 딥 앙상블의 4배보다 훨씬 낮다.
  • 신뢰도 모델은 주 모델의 파라미터 수의 1~3%만 추가하지만, 딥 앙상블은 파라미터 수를 400% 증가시킨다.
  • 제거 실험 결과, 거리 기반 표현 공간과 오류 기반 학습이 모두 필수적임을 확인했다. 모든 훈련 샘플을 사용해 신뢰도 모델을 훈련하면 성능이 떨어지고, 오직 오류 학습만으로는 성능 향상이 미미하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.