[논문 리뷰] Improving Out-of-Distribution Detection via Epistemic Uncertainty Adversarial Training
이 논문은 드롭아웃 앙상블의 사전적 불확실성 추정을 악성 공격하는 방식으로 외부 분포(OOD) 탐지 성능을 향상시키는 불확실성 적대적 훈련(UAT)을 제안한다. 사전적 불확실성 공격에 강건해지도록 훈련시킴으로써, UAT는 깨끗한 OOD 데이터에서 ${\rm AUC}_{\scriptscriptstyle{\rm FPR}<1\%}$를 ≥0.75로 끌어올리며, 적대적 편향이 가해진 상황에서도 높은 강건성을 유지하여, 저위험률에서 기존 기준 방법들을 크게 능가한다.
The quantification of uncertainty is important for the adoption of machine learning, especially to reject out-of-distribution (OOD) data back to human experts for review. Yet progress has been slow, as a balance must be struck between computational efficiency and the quality of uncertainty estimates. For this reason many use deep ensembles of neural networks or Monte Carlo dropout for reasonable uncertainty estimates at relatively minimal compute and memory. Surprisingly, when we focus on the real-world applicable constraint of $\leq 1\%$ false positive rate (FPR), prior methods fail to reliably detect OOD samples as such. Notably, even Gaussian random noise fails to trigger these popular OOD techniques. We help to alleviate this problem by devising a simple adversarial training scheme that incorporates an attack of the epistemic uncertainty predicted by the dropout ensemble. We demonstrate this method improves OOD detection performance on standard data (i.e., not adversarially crafted), and improves the standardized partial AUC from near-random guessing performance to $\geq 0.75$.
연구 동기 및 목표
- 기존의 불확실성 기반 OOD 탐지 방법이 저위험률(≤1%)에서 실패하는 이유를 조사한다. 특히 간단한 OOD 샘플(예: 가우시안 노이즈)을 탐지하는 데에서의 문제점을 다룬다.
- 드롭아웃 앙상블에서의 사전적 불확실성 추정치가 OOD 입력에서 불확실성을 감소시키는 타겟 공격에 얼마나 취약한지를 규명한다.
- 청결한 OOD 탐지 성능과 불확실성 타겟 공격에 대한 강건성을 동시에 향상시키는 새로운 적대적 훈련 기법을 개발한다.
- 청결한 정확도를 희생시키지 않고도 저위험률에서 개선된 OOD 탐지 성능을 달성할 수 있음을 입증함으로써, 일반적으로 존재하는 정확도-강건성 상충관계를 뒤집는다.
제안 방법
- 이 방법은 드롭아웃 앙상블이 예측하는 사전적 불확실성(상호정보량으로 측정)을 대상으로 한 타겟 공격을 도입한다.
- 이 공격은 불확실성 FGSM(UFGSM)으로 불리며, OOD 샘플에서 사전적 불확실성을 최소화하는 편향을 생성하여, OOD 입력이 잘못된 믿음(의심스럽지 않게)으로 보이게 한다.
- 모델은 이러한 불확실성 타겟 편향을 사용하여 적대적 훈련을 수행함으로써 추론 시 강건성을 향상시킨다.
- 훈련 과정은 몬테카를로 드롭아웃과 앙상블 평균을 결합하여 사전적 불확실성을 추정하며, 예측 간 상호정보량을 불확실성 점수로 사용한다.
- 이 방법은 표준 훈련 중에 적용되며, 손실 함수에 정규화를 적용하여 적대적 편향이 가해진 OOD 데이터에서 낮은 불확실성 수준을 유지하도록 한다.
- 이 방법은 여러 데이터셋(MNIST, FMNIST, CIFAR-10, SVHN, ImageNet)과 OOD 데이터 유형(실제, 위조, 노이즈, 적대적 공격를 받은 샘플)에 대해 평가된다.
실험 결과
연구 질문
- RQ1기존의 불확실성 기반 OOD 탐지 방법은 실제 적용에 필수적인 임계값인 FPR ≤1%에서 OOD 샘플을 신뢰성 있게 탐지할 수 있는가?
- RQ2드롭아웃 앙상블에서의 사전적 불확실성 추정치는 OOD 입력에서 불확실성을 감소시키는 타겟 공격에 얼마나 취약한가?
- RQ3불확실성 타겟 공격을 이용한 적대적 훈련은 청결한 OOD 탐지 성능과 이러한 공격에 대한 강건성을 동시에 향상시킬 수 있는가?
- RQ4제안된 방법은 OOD 탐지에서 일반적으로 존재하는 정확도-강건성 상충관계를 깨는가?
주요 결과
- 기존 기준 방법(딥 앙상블 및 몬테카를로 드롭아웃 포함)은 FPR ≤1%에서 OOD 샘플을 탐지하지 못하며, ${\rm AUC}_{\scriptscriptstyle{\rm FPR}<1\%}$ 점수가 랜덤 추측 수준(≈0.5)에 가까워, 가우시안 노이즈 조차도 마찬가지다.
- UFGSM 공격는 OOD 샘플에서 사전적 불확실성을 성공적으로 감소시켜, 이들이 내부 분포로 오인되게 하고, 거짓 음성 수를 증가시킨다.
- UAT로 훈련된 모델은 모든 평가된 데이터셋에서 깨끗한 OOD 데이터에서 ${\rm AUC}_{\scriptscriptstyle{\rm FPR}<1\%}$ ≥0.75를 달성하며, 기준 방법들을 크게 능가한다.
- UAT 방법은 UFGSM 공격 상황에서도 높은 강건성을 유지하며, 공격된 OOD 샘플에서 ${\rm AUC}_{\scriptscriptstyle{\rm FPR}<1\%}$ 점수가 0.91~1.00에 이르지만, 기준 방법은 거의 랜덤 성능으로 악화된다.
- UAT 방법은 청결한 정확도를 떨어뜨리지 않고 OOD 탐지 성능을 향상시켜, 불확실성 인식 모델에서 강건성과 정확도가 공존할 수 있음을 입증한다.
- 이 방법은 자연 이미지 데이터셋, 위조된 합성 데이터, 적대적 편향을 받은 샘플을 포함한 다양한 OOD 데이터 유형에서 일관된 성능 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.