Skip to main content
QUICK REVIEW

[논문 리뷰] Should Ensemble Members Be Calibrated?

Xixin Wu, Mark Gales|arXiv (Cornell University)|2021. 01. 13.
Anomaly Detection Techniques and Applications참고 문헌 33인용 수 9
한 줄 요약

이 논문은 딥 네ural 네트워크 앙상블에서 校정( calibration )에 대해 조사하며, 이론적으로도 실험적으로도 개별 앙상블 구성원을 校정한다고 해서 잘 校정된 앙상블 예측이 보장되지 않음을 보여준다. 대신 앙상블 출력은 별도로 校정되어야 하며, 지역별 온도를 적용하는 동적 온도 스케일링이 최소한의 파rameter 오 overhead 를 유지하면서도 뛰어난 校정 성능을 제공한다.

ABSTRACT

Underlying the use of statistical approaches for a wide range of applications is the assumption that the probabilities obtained from a statistical model are representative of the "true" probability that event, or outcome, will occur. Unfortunately, for modern deep neural networks this is not the case, they are often observed to be poorly calibrated. Additionally, these deep learning approaches make use of large numbers of model parameters, motivating the use of Bayesian, or ensemble approximation, approaches to handle issues with parameter estimation. This paper explores the application of calibration schemes to deep ensembles from both a theoretical perspective and empirically on a standard image classification task, CIFAR-100. The underlying theoretical requirements for calibration, and associated calibration criteria, are first described. It is shown that well calibrated ensemble members will not necessarily yield a well calibrated ensemble prediction, and if the ensemble prediction is well calibrated its performance cannot exceed that of the average performance of the calibrated ensemble members. On CIFAR-100 the impact of calibration for ensemble prediction, and associated calibration is evaluated. Additionally the situation where multiple different topologies are combined together is discussed.

연구 동기 및 목표

  • 앙상블 예측이 校정되는 이론적 조건을 분석하기 위해.
  • 교정된 앙상블 구성원과 교정된 앙상블 예측 사이의 괴리 현상을 조사하기 위해.
  • 특히 온도 스케일링을 포함한 후처리 校정 방법을 딥 앙상블 모델에 평가하기 위해.
  • 다양한 아키텍처를 가진 모델을 앙상블에 조합했을 때의 영향을 탐색하기 위해.
  • 향상된 校정 성능를 위해 지역별 온도 스케일링을 제안하고 평가하기 위해.

제안 방법

  • 표본 기반 한계가 아닌, 기본 데이터 분포에 기반한 校정 기준 이론적 분석.
  • DenseNet, ResNet 및 DenseNet 변종을 사용한 딥 앙상블을 활용한 CIFAR-100에서의 校정 실험적 평가.
  • 온도 스케일링을 통한 후처리 校정 적용, 전역, 구성원별(사전), 앙상블 수준(사후) 모드 포함.
  • 모델 복잡도를 과도하게 증가시키지 않으면서도 校정 성능을 향상시키기 위해 지역 기반 온도 파rameter 를 사용하는 동적 온도 스케일링 도입.
  • 성능 평가를 위해 신뢰도 다이어그램과 여러 校정 오차 지표(ECE, ACE, SKCE) 사용.
  • 이상형 앙상블의 가중치 최적화를 위해 최대우도와 AUC를 사용함.

실험 결과

연구 질문

  • RQ1개별 앙상블 구성원을 교정하면 잘 교정된 앙상블 예측이 보장되는가?
  • RQ2앙상블 구성원의 교정과 최종 앙상블 출력의 교정 사이의 이론적 관계는 무엇인가?
  • RQ3전역 스케일링에 비해 지역별 온도 스케일링이 교정 성능 향상에 기여하는가?
  • RQ4다른 아키텍처를 가진 모델을 조합하면 앙상블 교정 및 성능에 어떤 영향을 미치는가?
  • RQ5개별 구성원을 사전에 교정하는 것보다 앙상블 출력을 조합 후 교정하는 것이 더 효과적인가?

주요 결과

  • 개별 앙상블 구성원을 교정한다고 해서 잘 교정된 앙상블 예측이 보장되지 않으며, 앙상블 출력은 여전히 과소신뢰적이므로 별도로 교정이 필요하다.
  • 조합 후 교정(앙상블 출력 교정)은 사전 교정보다 유의미하게 낮은 교정 오차를 낳는다 (예: RSN에서 동적 스케일링으로 ECE가 1.20×10⁻²로 감소).
  • 6개의 지역을 사용하는 동적 온도 스케일링이 최고의 교정 성능을 보이며 (RSN에서 SKCE = 57.87×10⁻⁴), ECE는 1.20×10⁻²로 감소하여 전역 및 사전 교정 방법을 능가한다.
  • 동적 온도 스케일링의 지역 수를 늘릴수록 교정 성능이 향상되지만, 파rameter 수가 증가한다.
  • LEN, DSN100, DSN121, RSN을 조합한 이질적 아키텍처의 토폴로지 앙상블은 조합 후 교정 시 83.86% 정확도와 ECE 2.06×10⁻²를 달성하여 구성원의 교정 품질에 대해 강건함을 보였다.
  • 잘 교정된 구성원을 가진다 해도 앙상블 예측은 여전히 잘못 교정되어 있어, 앙상블 출력에 전용 교정이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.