Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Temperature Scaling: An Unsupervised Post-Processing Calibration Method of Deep Networks

Azadeh Sadat Mozafari, Hugo Siqueira Gomes|arXiv (Cornell University)|2019. 05. 01.
Cutaneous Melanoma Detection and Management참고 문헌 25인용 수 3
한 줄 요약

이 논문은 레이블이 없는 테스트 샘플만을 사용하여 딥 네ural 네트워크를 校정하는 데 unsupervised temperature scaling (UTS)을 제안한다. 이는 레이블이 있는 검증 데이터가 필요 없도록 하여, 라벨링 비용이 많이 들고 실생활 응용(예: 의료 진단)에서 비현실적인 문제를 해결한다. UTS는 모델 정확도와 계산 효율성을 유지하면서도, 피부 병변 진단에서 신뢰도 향상에 있어 상태의 기준 성능을 달성한다.

ABSTRACT

The great performances of deep learning are undeniable, with impressive results over a wide range of tasks. However, the output confidence of these models is usually not well-calibrated, which can be an issue for applications where confidence on the decisions is central to providing trust and reliability (e.g., autonomous driving or medical diagnosis). For models using softmax at the last layer, Temperature Scaling (TS) is a state-of-the-art calibration method, with low time and memory complexity as well as demonstrated effectiveness. TS relies on a T parameter to rescale and calibrate values of the softmax layer, whose parameter value is computed from a labelled dataset. We are proposing an Unsupervised Temperature Scaling (UTS) approach, which does not depend on labelled samples to calibrate the model, which allows, for example, the use of a part of a test samples to calibrate the pre-trained model before going into inference mode. We provide theoretical justifications for UTS and assess its effectiveness on a wide range of deep models and datasets. We also demonstrate calibration results of UTS on skin lesion detection, a problem where a well-calibrated output can play an important role for accurate decision-making.

연구 동기 및 목표

  • 딥 러닝에서 소프트맥스 출력이 과신뢰적이며 진정된 클래스 확률을 잘 반영하지 못하는 모델의 校정 문제를 해결하기 위해.
  • 의료 진단과 같이 실생활 응용에서 레이블이 있는 데이터가 비용이 많이 들고 비현실적이므로, 후처리 校정에 레이블이 필요 없는 의존성을 제거하기 위해.
  • 온도 스케일링의 낮은 복잡도와 정확도 유지 특성을 유지하면서도, 레이블이 없는 테스트 샘플만을 사용하여 校정이 가능한 방법을 개발하기 위해.
  • 특히 피부 병변 진단과 같이 높은 위험도를 지닌 응용 분야에서 UTS의 효과를 다양한 아키텍처와 데이터셋을 통해 검증하기 위해.

제안 방법

  • UTS는 소량의 레이블이 없는 테스트 데이터 서브셋에서 음의 로그우도(NLL)를 최소화하여 최적의 온도 파라미터 T를 추정한다. 이는 레이블이 필요 없도록 한다.
  • 분류 경계 근처에 위치한 샘플(클래스 확률이 균형을 이루는 곳)을 校정에 적합한 후보로 식별하며, 이들은 대칭적인 사후 분포를 가지므로 신뢰할 수 있다.
  • 임계값 θₖ는 잘못 분류된 샘플들에 대해 클래스 k의 소프트맥스 점수 평균과 표준편차의 합으로 계산되며, 높은 신뢰도를 가지며 모호한 예측을 선택한다.
  • 레이블이 없는 샘플들의 신뢰도 점수의 경험적 분포를 사용하여 진정한 校정 분포를 근사함으로써, 레이블 없이도 T 추정이 가능하다.
  • 후행 추론 후에 온도 스케일링 변환 S_y(x) = exp(h_y / T) / Σ_j exp(h_j / T)를 적용하여 신뢰도 출력을 재교정한다.
  • 이 방법은 결정 경계 근처의 샘플이 대칭적인 사후 가능도를 가지므로, 비지도 학습에 적합하다는 이론적 근거를 제시한다.

실험 결과

연구 질문

  • RQ1레이블이 없는 데이터만을 사용하여 레이블이 없는 테스트 샘플을 기반으로 딥 네트워크의 校정을 효과적으로 수행할 수 있는가?
  • RQ2UTS는 계산 비용을 최소화하면서도 감독 기반 온도 스케일링과 유사한 성능을 달성할 수 있는가?
  • RQ3레이블링 비용이 많이 드는 실제 응용 분야, 예를 들어 피부 병변 분류에서 UTS는 어떤 성능을 보이는가?
  • RQ4결정 경계 근처의 샘플을 신뢰성 있게 사용하여 온도 파라미터 T를 비지도 방식으로 추정할 수 있는가?
  • RQ5UTS는 잘못 분류된 샘플과 올바르게 분류된 샘플에 대해 각각 어떤 영향을 미치는가?

주요 결과

  • UTS는 레이블이 없는 모델보다 항상 더 나은 校정 성능을 보이며, 다양한 데이터셋과 아키텍처에서 감독 기반 온도 스케일링과 유사하거나 이를 초월한다.
  • ResNet18을 사용한 CIFAR-10에서는 ECE를 0.043에서 0.031로 감소시키고, NLL을 0.427에서 0.301로 감소시켜 일부 경우에서 TS를 능가한다.
  • ISIC 2018 피부 병변 진단에서 UTS는 잘못 분류된 샘플의 신뢰도를 크게 감소시키지만, 정확히 분류된 샘플의 높은 신뢰도를 유지한다.
  • 교정 후에도 모델 정확도를 유지함으로써, 온도 스케일링이 모델의 예측 순위를 변경하지 않는다는 점을 확인한다.
  • 실험 결과, 12개의 모델-데이터셋 조합 중 7개에서 UTS가 TS보다 더 나은 校정 성능을 보이며, 다양한 환경에서의 강건성을 입증한다.
  • 이론적 및 실증적 분석을 통해 레이블이 없는 데이터를 사용한 校정의 타당성을 입증하였으며, 결정 경계 근처의 샘플이 진정한 校정 분포를 신뢰할 만하게 추정할 수 있음을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.