Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Confidence Estimates for Unfamiliar Examples

Zhizhong Li, Derek Hoiem|arXiv (Cornell University)|2018. 04. 09.
Adversarial Robustness in Machine Learning참고 문헌 50인용 수 4
한 줄 요약

이 논문은 학습 중에 볼 수 없었던 유효한 예측 샘플에 대해 딥 러닝 모델이 과신하는 예측을 다루며, 校정 기법, 앙상블, 디스틸레이션, 베이지안 방법을 평가한다. 온도 스케일링을 적용한 앙상블 모델이 가장 뛰어난 성능을 보이며, 익숙한 데이터와 익숙하지 않은 데이터 분포 모두에서 레이블 오차, 校정 오차, 가능도 오차를 크게 감소시킨다.

ABSTRACT

Intuitively, unfamiliarity should lead to lack of confidence. In reality, current algorithms often make highly confident yet wrong predictions when faced with relevant but unfamiliar examples. A classifier we trained to recognize gender is 12 times more likely to be wrong with a 99% confident prediction if presented with a subject from a different age group than those seen during training. In this paper, we compare and evaluate several methods to improve confidence estimates for unfamiliar and familiar samples. We propose a testing methodology of splitting unfamiliar and familiar samples by attribute (age, breed, subcategory) or sampling (similar datasets collected by different people at different times). We evaluate methods including confidence calibration, ensembles, distillation, and a Bayesian model and use several metrics to analyze label, likelihood, and calibration error. While all methods reduce over-confident errors, the ensemble of calibrated models performs best overall, and T-scaling performs best among the approaches with fastest inference. Our code is available at https://github.com/lizhitwo/ConfidenceEstimates . $\color{red}{ ext{Please see UPDATED ERRATA.}}$

연구 동기 및 목표

  • 학습 중에 볼 수 없었지만 의미적으로 유효한 테스트 샘플에 대해 딥 네URAL 네트워크가 매우 확신하면서도 잘못된 예측을 내는 문제를 조사하고 해결하는 것.
  • 특성(예: 연령, 품종) 또는 샘플링 변동(예: 다른 데이터 수집 기간)을 기반으로 테스트 데이터를 익숙한 집합과 익숙하지 않은 집합으로 체계적으로 분할하는 방법론을 개발하고 평가하는 것.
  • 예측 신뢰도의 신뢰성을 향상시키기 위해 신뢰도 校정, 앙상블, 디스틸레이션, 베이지안 불확실성 추정의 효과를 비교하는 것.
  • 일반적인 i.i.d. 검증 세트에서의 校정은 익숙하지 않은 데이터에서 과신을 유도하므로, 전용 평가 및 튜닝 전략이 필요하다는 것을 보여주는 것.

제안 방법

  • 특성 기반(예: 연령, 품종) 또는 샘플링 기반(예: 다른 데이터 수집 기간) 분할을 사용해 테스트 데이터를 익숙한 집합과 익숙하지 않은 집합으로 나누는 새로운 평가 프레임워크를 제안한다.
  • 신뢰도 校정을 위해 온도 스케일링(T-scaling)을 적용하며, 검증 세트에서 온도 파라미터를 최적화하여 校정 및 가능도 점수를 향상시킨다.
  • T-스케일드 분류기의 앙상블을 활용해 불확실성 추정을 향상시키고 과신을 줄이며, 모델 간 예측의 분산을 활용한다.
  • 앙상블의 성능을 단일 모델으로 전이하기 위해 지식 디스틸레이션과 생성형 디스틸레이션(G-distillation)을 도입하며, 낮은 추론 비용으로 정확도와 校정을 유지하고자 한다.
  • 몬테카를로 드롭아웃(MC-Dropout)을 통한 베이지안 딥 러닝을 활용해 예측 불확실성을 추정하고 다른 방법과 비교한다.
  • 레이블 오차, 기대 校정 오차(ECE), 음의 로그가능도(NLL), 브리어 점수와 같은 표준 지표를 사용해 익숙한 데이터와 익숙하지 않은 데이터 모두에서 모델 성능을 평가한다.

실험 결과

연구 질문

  • RQ1학습 중에 볼 수 없었던 유효한 예측 샘플에 대해 딥 네URAL 네트워크는 신뢰도 校정과 예측 정확도에서 어떻게 성능을 내는가?
  • RQ2기준 모델 대비 T-스케일링과 같은 신뢰도 校정 기법이 익숙하지 않은 데이터에서 과신 오차를 얼마나 줄일 수 있는가?
  • RQ3앙상블 방법, 디스틸레이션, 베이지안 모델은 익숙하지 않은 샘플의 신뢰도 추정 향상에 어떻게 비교되는가?
  • RQ4i.i.d. 검증 세트에서 튜닝된 校정은 익숙하지 않은 데이터에서 과신 예측을 유도하는가? 그리고 다른 방식으로 샘플링된 검증 세트를 사용하면 이를 완화할 수 있는가?
  • RQ5지식 디스틸레이션은 앙상블 모델의 강건성을 단일 모델로 효과적으로 전이할 수 있는가? 이때 익숙하지 않은 데이터에서 낮은 校정 오차와 레이블 오차를 유지할 수 있는가?

주요 결과

  • 익숙하지 않은 샘플은 익숙한 샘플보다 유의미하게 높은 校정 오차와 레이블 오차를 보이며, 특히 새로운 연령 그룹에 대해 잘못된 99% 신뢰도 예측을 내릴 가능성이 익숙한 그룹보다 12배 높다.
  • 온도 스케일링을 적용한 앙상블 모델이 모든 데이터셋과 분할에서 레이블 오차, 校정 오차, NLL, 브리어 점수 모두에서 가장 낮은 수준을 기록하며, 다른 모든 방법보다 뛰어난 성능을 보였다.
  • T-스케일링만으로도 익숙한 데이터와 익숙하지 않은 데이터 모두에서 가능도 오차와 校정 오차를 감소시키며, 추론 비용이 최소한인 단일 모델 접근법 중에서 가장 우수한 성능을 보였다.
  • 디스틸레이션과 G-디스틸레이션은 T-스케일링을 일관되게 능가하지 못하며, 훈련 복잡도가 증가했음에도 성능 향상이 없었다.
  • 베이지안 방법(Kendall et al.)은 전반적으로 두 번째로 우수한 성능을 보였으며, 앙상블보다 약간 높은 레이블 오차를 보였지만, 유사한 수준의 校정 개선 효과를 보였다.
  • i.i.i. 검증 세트에서의 校정은 익숙하지 않은 샘플에 대해 신뢰도를 과대평가하는 결과를 초래하며, 이는 최적의 校정을 위해 분포 이탈이 있는 검증 세트가 필요하다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.