[논문 리뷰] Certifiably Adversarially Robust Detection of Out-of-Distribution Data
이 논문은 깊이 신경망 분류기가 적대적 OOD 편향에 대해 안정적인 낮은 신뢰도를 유지하도록 보장하는 GOOD(Guaranteed Out-of-distribution Detection)을 제안한다. 이 방법은 임의의 OOD 점을 중심으로 한 l∞-공 내에서 분류기의 신뢰도를 인증 가능한 방식으로 낮추며, 훈련 중에 간격 경계 전파(IBP)를 활용해 이러한 공 내 최대 신뢰도의 상한을 최소화함으로써, 성능 저하 없이 적대적 OOD 편향에 대해 인증 가능한 강건성을 확보한다.
Deep neural networks are known to be overconfident when applied to out-of-distribution (OOD) inputs which clearly do not belong to any class. This is a problem in safety-critical applications since a reliable assessment of the uncertainty of a classifier is a key property, allowing the system to trigger human intervention or to transfer into a safe state. In this paper, we aim for certifiable worst case guarantees for OOD detection by enforcing not only low confidence at the OOD point but also in an $l_\infty$-ball around it. For this purpose, we use interval bound propagation (IBP) to upper bound the maximal confidence in the $l_\infty$-ball and minimize this upper bound during training time. We show that non-trivial bounds on the confidence for OOD data generalizing beyond the OOD dataset seen at training time are possible. Moreover, in contrast to certified adversarial robustness which typically comes with significant loss in prediction performance, certified guarantees for worst case OOD detection are possible without much loss in accuracy.
연구 동기 및 목표
- 딥 뉴럴 네트워크 분류기가 적대적 편향이 가해진 상황에서도 OOD 데이터에 대해 낮은 신뢰도를 유지할 수 있도록 worst-case 보장을 제공하는 것.
- 기존에 간과되기 쉬운 OOD 입력으로까지 확장된 인증 가능한 강건성을 제공함으로써, 기존의 분포 내 적대적 예제에 한정된 인증 강건성의 범위를 넓히는 것.
- 훈련 중에 볼 수 없었던 OOD 데이터셋(예: MNIST 숫자를 훈련 데이터로 사용할 때 EMNIST 문자)에도 일반화 가능한 OOD 탐지 보장을 개발하는 것.
- 기존의 인증된 적대적 강건성 방법들과 달리, 분포 내 분류 작업에서의 성능 저하 없이 인증 가능한 OOD 강건성을 확보하는 것.
제안 방법
- 임의의 주어진 OOD 점을 중심으로 한 l∞-공 내에서 분류기의 최대 신뢰도에 대한 인증 가능한 상한을 계산하기 위해 간격 경계 전파(IBP)를 활용한다.
- 새로운 목적 함수를 통해 IBP를 통해 유도된 이 상한을 훈련 중에 최소화함으로써, OOD 입력 주변의 ε-공 내 어떤 점에도 높은 신뢰도를 부여할 수 없도록 보장한다.
- 최악의 상황에서도 OOD 신뢰도 상한을 최소화하도록 전용으로 최적화된 GOOD(Guaranteed Out-of-distribution Detection) 훈련 체계를 도입한다.
- 다양한 OOD 데이터를 훈련 중에 인증된 상한 최소화에 활용함으로써, 훈련 중에 볼 수 없었던 관련된 그러나 새로운 OOD 데이터셋으로의 일반화를 가능하게 한다.
- IBP 상한의 미분 가능 근사화를 활용해 표준 백프로파게이션을 통한 엔드 투 엔드 훈련을 가능하게 한다.
- 다양한 데이터셋과 ε 값에서 AAUC 및 GAUC 지표를 활용해 인증 보장을 검증함으로써, 훈련 중 OOD 분포를 초월한 일반화 능력을 입증한다.
실험 결과
연구 질문
- RQ1l∞-노름에서 적대적 편향이 가해진 상황에서도 깊이 신경망이 OOD 입력에 대해 낮은 신뢰도를 유지할 수 있도록 인증 가능한 보장을 제공할 수 있는가?
- RQ2IBP 훈련을 통한 OOD 강건성 인증이 기존의 적대적 강건성 방법처럼 분포 내 분류 작업에서 상당한 정확도 손실을 초래하는가?
- RQ3훈련 중에 존재하지 않은 OOD 데이터셋(예: MNIST 숫자를 훈련 데이터로 사용할 때 EMNIST 문자)으로도 인증 가능한 OOD 탐지 보장이 일반화 가능한가?
- RQ4적대적 강건성 외의 최첨단 OOD 탐지 방법들인 Outlier Exposure(OE), ACET, CCU와 비교해 GOOD의 성능은 어떻게 되는가? 특히 더 큰 편향 반경에서의 인증 강건성과 일반화 능력 측면에서 평가한다.
- RQ5기존 방법이 실패하는 분포 내 다각형에 가까운 OOD 점 주변의 l∞-공에서 의미 있는 최악의 상황에서의 신뢰도 상한을 확보할 수 있는가?
주요 결과
- GOOD는 OOD 탐지에 대해 인증 가능한 최악의 상황에서의 신뢰도 상한을 확보한다: CIFAR-100의 침팬지 이미지 주변의 l∞-공에서 ε = 0.01일 때, 모든 클래스에 대해 신뢰도 < 22.7%를 보장한다.
- GOOD는 분포 내 정확도에서 최첨단 성능을 유지를 하면서도(예: ε = 0.03일 때 CIFAR-10에서 99.1%), 인증 가능한 OOD 강건성을 제공한다. 반면 기존의 적대적 강건성 방법들은 상당한 정확도 저하를 겪는다.
- MNIST → EMNIST 문자 OOD 탐지 과제에서, GOOD는 ε = 0.08일 때 GAUC 84.5%를 기록하며 ACET(52.1%)와 OE(63.6%)를 능가하고, 훈련 중에 볼 수 없었던 OOD 데이터로도 일반화된다.
- GOOD는 더 큰 ε 값으로도 잘 일반화된다: MNIST에서 훈련한 후 CIFAR-10에서 ε = 0.1일 때 GAUC 77.3%를 기록하며, ACET(52.1%)와 OE(63.6%)보다 뚜렷이 뛰어나다.
- 모든 평가된 데이터셋과 ε 값에서 최첨단의 AAUC 및 GAUC 성능을 확보함으로써, 훈련 시 사용된 위협 모델을 초월한 인증 가능한 OOD 강건성의 일반화 능력이 뛰어나다는 것을 입증한다.
- GOOD의 인증 상한은 비어 있지 않으며 의미 있는 수준이다: 예를 들어, 모델이 그와 같은 이미지로 훈련된 바 없음에도 불구하고 침팬지 이미지 주변의 l∞-공에서 신뢰도 < 22.7%를 보장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.