[논문 리뷰] Better the Devil you Know: An Analysis of Evasion Attacks using Out-of-Distribution Adversarial Examples
이 논문은 개방형 딥러닝 시스템에서 탐지와 오분류를 회피하기 위해 분포 외 입력에 대해 적용된 편향(왜곡)을 포함하는 분포 외(Out-of-Distribution, OOD) 적대적 예제를 소개한다. 이는 최신 방어 기법들인 강건한 훈련과 OOD 탐지기에도 효과가 없음을 입증하며, OOD 입력을 명시적으로 모델링하기 위해 반복적 적대적 훈련과 배경 클래스 증강을 조합한 하이브리드 방법을 제안한다. 이는 OOD 적대적 공격의 성공률을 최대 84%까지 감소시킨다.
A large body of recent work has investigated the phenomenon of evasion attacks using adversarial examples for deep learning systems, where the addition of norm-bounded perturbations to the test inputs leads to incorrect output classification. Previous work has investigated this phenomenon in closed-world systems where training and test inputs follow a pre-specified distribution. However, real-world implementations of deep learning applications, such as autonomous driving and content classification are likely to operate in the open-world environment. In this paper, we demonstrate the success of open-world evasion attacks, where adversarial examples are generated from out-of-distribution inputs (OOD adversarial examples). In our study, we use 11 state-of-the-art neural network models trained on 3 image datasets of varying complexity. We first demonstrate that state-of-the-art detectors for out-of-distribution data are not robust against OOD adversarial examples. We then consider 5 known defenses for adversarial examples, including state-of-the-art robust training methods, and show that against these defenses, OOD adversarial examples can achieve up to 4$ imes$ higher target success rates compared to adversarial examples generated from in-distribution data. We also take a quantitative look at how open-world evasion attacks may affect real-world systems. Finally, we present the first steps towards a robust open-world machine learning system.
연구 동기 및 목표
- 개방형 기계학습 환경에서, 모델이 알려지지 않은 분포에서 온 입력을 만날 수 있는 상황에서의 회피 공격 위협을 조사하는 것.
- 분포 외 데이터에서 제작된 적대적 예제에 대해 최신의 OOD 탐지 및 적대적 방어 메커니즘의 취약성을 분석하는 것.
- 기존의 방어 기법이 OOD 적대적 예제에 직면했을 때의 효과성을 평가하여 현재의 강건성 가정에 대한 핵심적인 약점을 드러내는 것.
- 배경 클래스를 사용한 선택적 예측과 함께 반복적 적대적 훈련을 조합한 새로운 방어 전략을 제안하여 OOD 적대적 예제에 대한 강건성을 향상시키는 것.
제안 방법
- 저자들은 분포 내 데이터가 아닌 분포 외 데이터(예: ImageNet, VOC12, MNIST)에서 온 입력에 노름 제한된 편향을 적용하여 OOD 적대적 예제를 생성한다.
- CIFAR-10, SVHN, 그리고 Tiny ImageNet에서 훈련된 11종의 최신 딥 네트워크를 평가하여 OOD 적대적 공격에 대한 강건성을 분석한다.
- 하이브리드 방어 전략을 제안한다: OOD 입력을 명시적으로 모델링하기 위해 배경 클래스를 포함한 적대적 훈련을 수행하며, 각 4개의 OOD 데이터셋(MNIST, ImageNet, VOC12, 인터넷 사진)에서 5,000장의 이미지를 사용한다.
- 이 방법은 분포 내 데이터에 OOD 샘플을 추가하여 반복적 적대적 훈련(Madry et al.과 유사)을 수행함으로써, 모델이 강건한 결정 경계를 학습할 수 있도록 한다.
- 공격의 효과를 정량화하기 위해 주로 목표 성공률을 사용하며, 이는 고도로 신뢰도가 높은 목표 오분류를 달성한 OOD 적대적 예제의 비율을 측정한다.
- 강건성의 일반화 능력을 평가하기 위해, 훈련에 사용되지 않은 OOD 데이터셋에서의 OOD 적대적 예제에 대해 모델의 성능을 테스트한다.
실험 결과
연구 질문
- RQ1분포 외(OOD) 입력은 개방형 딥러닝 시스템에서 탐지되거나 고도로 신뢰도가 높은 오분류를 유도하는 적대적 예제로 조작될 수 있는가?
- RQ2분포 내 적대적 예제에 비해, 기존의 최신 OOD 탐지 및 적대적 방어 메커니즘은 OOD 적대적 예제에 대해 얼마나 효과적인가?
- RQ3배경 클래스와 OOD 데이터를 사용한 적대적 훈련은 다양한 OOD 데이터셋에 걸쳐 OOD 적대적 공격에 대한 강건성을 얼마나 향상시킬 수 있는가?
- RQ4한 개의 OOD 데이터셋에서 학습한 강건성은 다른 OOD 데이터셋으로 일반화되는가? 그리고 훈련 시 여러 OOD 데이터셋을 조합하면 전체 방어 성능에 어떤 영향을 미치는가?
주요 결과
- 최신 방어 기법을 공격할 때, OOD 적대적 예제는 분포 내 예제에 비해 최대 4배 높은 목표 공격 성공률를 기록한다.
- 기존의 OOD 탐지 기법은 OOD 적대적 예제를 탐지하지 못한다. 이는 이러한 예제가 다른 분포에서 온 것으로도 불구하고 높은 신뢰도로 목표 클래스로 분류되기 때문이다.
- 오직 5,000장의 OOD 이미지(예: ImageNet에서의 이미지)만을 사용한 적대적 훈련으로도 OOD 적대적 예제의 목표 성공률가 44.9%에서 7.4%로 감소하여 강건성 향상 효과가 뚜렷하다.
- 한 개의 OOD 데이터셋(VOC12)에서 학습한 강건성은 다른 OOD 데이터셋으로 일반화되며, ImageNet 기반 OOD 적대적 예제에 대해 공격 성공률가 44.9%에서 15.8%로 감소한다.
- MNIST, ImageNet, VOC12, 인터넷 사진의 다수의 OOD 데이터셋을 함께 사용한 적대적 훈련은 모든 OOD 소스에서 가장 낮은 총 목표 성공률를 기록하여 최고의 성능을 보였다.
- 제안된 하이브리드 방어 전략은 분포 내 정확도에 거의 영향을 주지 않으며, 네 개의 OOD 데이터셋 모두를 사용해 훈련하더라도 최대 3.1%의 정확도 감소만을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.