[논문 리뷰] Calibrated Selective Classification
이 논문은 신뢰도가 떨어지는 예측을 거부하기 위해 별도의 선택자 네트워크를 훈련시켜 선택적 분류에서 불확실성 캘리브레이션을 향상시키는 선택적 캘리브레이션 프레임워크를 소개한다. 이 방법은 입력 변형을 사용한 분포로 보존 최적화를 통해 분포 이탈 상황에서도 일반화 능력을 향상시키며, 신뢰도 기반 기준선 대비 이미지 및 의료 분류 과제에서 유의미하게 낮은 선택적 캘리브레이션 오차를 달성한다.
Selective classification allows models to abstain from making predictions (e.g., say "I don't know") when in doubt in order to obtain better effective accuracy. While typical selective models can be effective at producing more accurate predictions on average, they may still allow for wrong predictions that have high confidence, or skip correct predictions that have low confidence. Providing calibrated uncertainty estimates alongside predictions -- probabilities that correspond to true frequencies -- can be as important as having predictions that are simply accurate on average. However, uncertainty estimates can be unreliable for certain inputs. In this paper, we develop a new approach to selective classification in which we propose a method for rejecting examples with "uncertain" uncertainties. By doing so, we aim to make predictions with {well-calibrated} uncertainty estimates over the distribution of accepted examples, a property we call selective calibration. We present a framework for learning selectively calibrated models, where a separate selector network is trained to improve the selective calibration error of a given base model. In particular, our work focuses on achieving robust calibration, where the model is intentionally designed to be tested on out-of-domain data. We achieve this through a training strategy inspired by distributionally robust optimization, in which we apply simulated input perturbations to the known, in-domain training data. We demonstrate the empirical effectiveness of our approach on multiple image classification and lung cancer risk assessment tasks.
연구 동기 및 목표
- 선택적 분류 모델이 불확실한 입력에서 기각함에도 불구하고 잘못 캘리브레이션된 예측을 내는 한계를 해결하기 위해.
- 모델이 내리는 예측이 정확할 뿐 아니라 수용된 예시들에 대해 불확실성 추정치가 잘 캘리브레이션되어 있음을 보장하기 위해.
- 기본 모델의 신뢰도가 낮은 예측뿐만 아니라 '불확실한' 신뢰도(즉, 신뢰할 수 없는 신뢰도 추정치)를 가진 예측에 대해서도 기각할 수 있도록 하는 프레임워크를 개발하기 위해.
- 분포로 보존 최적화를 통해 도메인 내 데이터에 변형을 가한 것을 활용해 선택자 네트워크를 훈련시켜, 분포 이탈 상황에서도 캘리브레이션의 강건성을 향상시키기 위해.
- 의료 진단과 같은 고위험 응용 분야에서 특히 강력한 선택적 캘리브레이션을 달성하면서도 충분한 예측 커버리지 유지를 유지하기 위해.
제안 방법
- 기본 모델 f(X)가 신뢰도 추정치를 제공하고, 별도의 선택자 g(X)가 신뢰도 신뢰성에 따라 예측을 수용할지 거부할지 결정하는 이중 단계 프레임워크를 제안한다.
- 선택적 캘리브레이션을 새로운 캘리브레이션 성질로 도입: 수용된 예시에 한해 f(X)=α 이고 g(X)=1 인 조건에서 E[Y | f(X)=α, g(X)=1] = α 를 만족한다.
- 선택자 네트워크를 최적화하기 위해 S-MMCE(선택적 다중클래스 기대 캘리브레이션 오차) 기반의 새로운 훈련 목표를 도입한다.
- 도메인 내 훈련 데이터에 입력 변형을 시뮬레이션하여 분포로 보존 최적화를 적용함으로써, 도메인 외부 분포로의 일반화 능력을 향상시킨다.
- 다양하고 현실적인 분포 이탈을 훈련 중에 생성하기 위해 변형 가족 T(예: AugMix)를 활용하여 강건성을 향상시킨다.
- 기각 결정의 미분 가능 근사화를 사용해 선택자 네트워크를 엔드 투 엔드로 훈련시켜 기울기 기반 최적화를 가능하게 한다.
실험 결과
연구 질문
- RQ1전체적으로만 아니라 수용된 예시의 부분집합에 대해서도 예측이 잘 캘리브레이션되어 있음을 보장할 수 있는 선택적 분류 시스템을 설계할 수 있는가?
- RQ2기본 모델의 신뢰도가 잘못 캘리브레이션되어 있을 경우, 선택적 모델의 불확실성 추정치의 신뢰도를 어떻게 향상시킬 수 있는가?
- RQ3도메인 내 데이터에 변형을 가한 선택자 네트워크가 도메인 외부 분포로의 일반화 능력은 어느 정도 향상되며, 선택적 캘리브레이션을 유지할 수 있는가?
- RQ4신뢰도가 아닌 신뢰도의 불확실성에 기반해 예측을 기각하는 것이, 특히 희귀하거나 어려운 케이스에서 클래스 간 예측 커버리지 균형을 어떻게 향상시킬 수 있는가?
- RQ5변형 가족 T의 선택이 최종 선택적 분류기의 강건성 및 캘리브레이션 성능에 어떤 영향을 미치는가?
주요 결과
- 제안된 S-MMCE 기반 선택자 네트워크는 분포 이탈 상황에서 CIFAR-10-C에서 기존의 신뢰도 기반 기준선 대비 선택적 캘리브레이션 오차 AUC(예: 0.028 vs. 0.062)를 유의미하게 낮춘다.
- MGH 폐암 위험 평가 데이터셋에서, 이 방법은 90% 커버리지 수준에서 기존의 신뢰도 기반 방법보다 암 환자(Y=1)의 기각 수를 줄였다. 이는 기각률의 불균형을 감소시켰다.
- 수용된 예시들 내에서의 신뢰도 점수 분포가 근사 분포와 매우 유사하게 유지되어, 다양한 클래스 간 모델 행동의 보존이 잘 이루어졌음을 시사한다.
- 절단 실험 결과, 훈련 중에 변형(T)을 사용할 경우, 이를 사용하지 않은 경우 대비 선택적 캘리브레이션 오차가 50% 이상 향상됨을 확인했다.
- 기본 모델 f(X)가 AugMix 변형을 사용해 훈련된 경우조차도, 제안된 선택자 네트워크가 유의미하게 낮은 선택적 캘리브레이션 오차를 달성함으로써, 후처리 캘리브레이션 도구로서의 효과성을 입증했다.
- 표준적인 신뢰도 기반 기각 전략과 달리, 이 방법은 분포 이탈 상황에서도 잘 일반화되어 도메인 외부 데이터에서 낮은 캘리브레이션 오차를 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.