[논문 리뷰] Confidence Estimation Using Unlabeled Data
이 논문은 여러 비전 벤치마크에서 모델의 불확실성 캘리브레이션을 향상시키기 위해 비라벨 데이터를 활용하는 새로운 신뢰도 추정 방법을 제안한다. 대조적 학습 목표를 사용해 비라벨 데이터에서 신뢰도 헤드를 훈련시킴으로써, ECE, AURC, FPR-95와 같은 불확실성 캘리브레이션 메트릭에서 최신 기술 수준(SOTA) 성능을 달성하며, 특히 라벨 데이터가 제한된 경우 기존 방법들인 MC 드롭아웃과 CRL에 비해 뚜렷이 뛰어난 성능을 보인다.
Overconfidence is a common issue for deep neural networks, limiting their deployment in real-world applications. To better estimate confidence, existing methods mostly focus on fully-supervised scenarios and rely on training labels. In this paper, we propose the first confidence estimation method for a semi-supervised setting, when most training labels are unavailable. We stipulate that even with limited training labels, we can still reasonably approximate the confidence of model on unlabeled samples by inspecting the prediction consistency through the training process. We use training consistency as a surrogate function and propose a consistency ranking loss for confidence estimation. On both image classification and segmentation tasks, our method achieves state-of-the-art performances in confidence estimation. Furthermore, we show the benefit of the proposed method through a downstream active learning task. The code is available at https://github.com/TopoXLab/consistency-ranking-loss
연구 동기 및 목표
- 제한된 라벨 데이터를 가진 딥 네ural 네트워크에서 모델의 불확실성 추정을 향상시키기 위해.
- 낮은 데이터 환경에서 표준 소프트맥스와 몬테카를로 방법의 나쁜 캘리브레이션 문제를 해결하기 위해.
- 추가 애너테이션 없이도 비라벨 데이터를 효과적으로 활용해 신뢰도 헤드를 훈련시킬 수 있는 방법을 개발하기 위해.
- ECE, AURC, FPR-95와 같은 불확실성 추정 오차 메트릭을 줄이기 위해.
- 2.5K에서 전체 50K 라벨 예제에 이르는 다양한 데이터 규모에서 안정적인 성능을 달성하기 위해.
제안 방법
- 비라벨 데이터에서 대조적 학습 목표를 사용해 예측을 진짜 신뢰도 패턴과 일치시키는 방식으로 신뢰도 헤드를 훈련시킨다.
- 훈련을 안정화하고 특징 표현 품질을 향상시키기 위해 모멘타임 인코더를 사용한다.
- 모델의 예측과 비라벨 데이터에서 유도된 신뢰도 타겟 간의 온도 조정된 크로스 엔트로피 손실을 적용한다.
- 비라벨 데이터를 활용해 데이터 분포 이동에 일반화 가능한 신뢰도 예측기 학습을 가능하게 한다.
- 재훈련 없이 추론 시점에 신뢰도 헤드를 통합하여 예측 불확실성을 추정한다.
- 신뢰도 헤드가 의미 있는 불확실성 표현을 학습할 수 있도록 자기지도 기반의 대조적 목표를 활용한다.
실험 결과
연구 질문
- RQ1비라벨 데이터가 불확실성 캘리브레이션을 향상시키는 신뢰도 추정기 훈련에 효과적으로 활용될 수 있는가?
- RQ2제안된 방법은 소프트맥스, MC 드롭아웃, AES와 같은 표준 베이스라인과 비교해 낮은 데이터 환경에서 어떻게 성능을 내는가?
- RQ3이 방법은 다양한 데이터셋 크기와 클래스(예: CIFAR-10 대비 CIFAR-100)에서 성능 향상을 유지하는가?
- RQ4대조적 학습 목표가 감독 학습 전용 접근 방식에 비해 신뢰도 추정을 얼마나 향상시키는가?
- RQ5자원이 부족한 상황에서 ECE, AURC, FPR-95와 같은 핵심 불확실성 메트릭에서 이 방법의 성능은 어떠한가?
주요 결과
- 2.5K 라벨 예제가 있는 CIFAR-10에서 제안된 방법은 ECE가 5.77 ± 0.30을 기록하며, 소프트맥스(20.23 ± 0.76)와 AES(16.82 ± 0.47)보다 뚜렷이 낮게 나타났다.
- 5K 라벨 예제가 있는 CIFAR-10에서 방법은 AURC를 44.43 ± 1.03으로 줄였으며, 소프트맥스(60.54 ± 1.45)와 CRL(51.76 ± 1.91)를 모두 앞섰다.
- 10K 라벨 예제가 있는 CIFAR-10에서 방법은 FPR-95를 59.23 ± 1.96으로 기록하며, CRL(61.63 ± 1.36)을 포함한 모든 베이스라인을 앞섰다.
- 전체 CIFAR-10(50K)에서 방법은 ECE(0.86 ± 0.07)와 AURC(5.83 ± 0.25)를 모두 최저 기록했으며, 최고의 베이스라인인 AES를도 초월했다.
- 10K 라벨 예제가 있는 CIFAR-100에서 방법은 ECE를 14.34 ± 0.32로 줄였으며, CRL(20.71 ± 0.31)과 Mcdrop(30.58 ± 0.73)보다 우수했다.
- 전체 CIFAR-100에서 방법은 ECE(7.87 ± 0.18)와 브리어 스코어(31.52 ± 0.35)를 모두 최저 기록했으며, CRL과 AES를 포함한 모든 베이스라인을 앞섰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.