[논문 리뷰] Are Odds Really Odd? Bypassing Statistical Detection of Adversarial Examples
이 논문은 유해 예측 예측의 로짓 통계를 정상 이미지의 로짓 통계와 모방하는 방식으로, 통계적 및 분류기 기반 탐지 방법을 우회하는 로짓 모방 공격(Logit Mimicry Attack, LMA)을 제안한다. 조건부로 반복적으로 훈련된 탐지기조차도 실패함으로써, 로짓 기반 탐지는 유해 예측 예측을 식별하는 데 근본적으로 신뢰할 수 없다는 것을 입증한다.
Deep learning classifiers are known to be vulnerable to adversarial examples. A recent paper presented at ICML 2019 proposed a statistical test detection method based on the observation that logits of noisy adversarial examples are biased toward the true class. The method is evaluated on CIFAR-10 dataset and is shown to achieve 99% true positive rate (TPR) at only 1% false positive rate (FPR). In this paper, we first develop a classifier-based adaptation of the statistical test method and show that it improves the detection performance. We then propose Logit Mimicry Attack method to generate adversarial examples such that their logits mimic those of benign images. We show that our attack bypasses both statistical test and classifier-based methods, reducing their TPR to less than 2:2% and 1:6%, respectively, even at 5% FPR. We finally show that a classifier-based detector that is trained with logits of mimicry adversarial examples can be evaded by an adaptive attacker that specifically targets the detector. Furthermore, even a detector that is iteratively trained to defend against adaptive attacker cannot be made robust, indicating that statistics of logits cannot be used to detect adversarial examples.
연구 동기 및 목표
- 통계적 탐지 방법을 개선하기 위해 이를 분류기 기반 접근법으로 변형한다.
- 정상 이미지의 로짓 통계와 구분되지 않는 로짓 통계를 갖는 유해 예측 예측을 생성하는 공격을 개발한다.
- 분류기와 탐지기를 동시에 공격하는 적응형 공격자에 대비한 탐지 방법의 강건성을 평가한다.
- 반복적 훈련을 통해 로짓 기반 탐지의 강건성을 높일 수 있는지 조사한다.
제안 방법
- 정상 및 노이즈가 가미된 로짓을 입력으로 사용하여, 유해 예측 예측을 탐지하는 통계적 검정 방법의 분류기 기반 변형을 제안한다.
- 노이즈 하에서 정상 이미지의 로짓 분포와 일치하는 로짓을 갖는 유해 예측 예측을 생성하기 위해 로짓 모방 공격(LMA)을 개발한다.
- 표준 유해 예측 손실과 탐지기 손실을 동시에 고려하는 손실 함수를 사용하여, 분류기와 탐지기를 동시에 우회한다.
- 모의 유해 예측 예측으로 탐지기를 훈련시켜 성능을 향상시키고, 이후 적응형 공격에 대한 강건성을 테스트한다.
- 특히 탐지기를 우회하기 위해 설계된 유해 예측 예측을 사용하여 탐지기를 반복적으로 재훈련함으로써, 적응형 공격자 시뮬레이션을 수행한다.
- α=0.25를 사용하여, 네트워크와 탐지기 양쪽의 우회를 균형 있게 유지하는 병합 손실 함수 ℓ_adaptive(x,yt) = αℓ_LMA(x,yt) + (1−α)ℓ_D(x)를 사용한다.
실험 결과
연구 질문
- RQ1통계적 탐지 방법의 분류기 기반 변형이 원래 검정 방식을 초월해 탐지 성능을 향상시킬 수 있는가?
- RQ2정상 이미지의 로짓 통계와 유사하게 모의된 로짓 통계를 갖는 유해 예측 예측을 제작할 수 있는가? 이를 통해 탐지에서 벗어날 수 있는가?
- RQ3모의 유해 예측 예측으로 훈련된 탐지기가 분류기와 탐지기를 동시에 공격하는 적응형 공격자에 대비해 여전히 강건한가?
- RQ4특히 탐지기를 공격하는 적응형 공격에 대비해 반복적으로 훈련된 탐지기를 강건하게 만들 수 있는가?
- RQ5로짓의 통계적 특성이 정상 예측과 유해 예측 예측 간의 근본적 차이를 반영하는가?
주요 결과
- 통계적 검정 방법의 분류기 기반 변형은 원래 검정 방식을 초월해 탐지 성능을 향상시키며, 특히 낮은 노이즈 조건에서 더 높은 진성 양성률을 달성한다.
- 로짓 모방 공격는 통계적 검정과 분류기 기반 탐지 양쪽을 성공적으로 우회하여, 5%의 위양성률에서도 진성 양성률이 각각 2.2% 미만, 1.6% 미만으로 감소한다.
- 모의 유해 예측 예측으로 훈련된 탐지기는 5% FPR에서 62.7%의 진성 양성률을 달성하지만, 적응형 공격자에 의해 우회되어 5% FPR에서 진성 양성률이 1.7%로 감소한다.
- 적응형 공격에 대비해 반복적으로 재훈련된 탐지기 역시 강건성을 유지하지 못하며, 5% FPR에서 진성 양성률이 오직 2.9%에 그친다.
- 결과적으로, 정상 예측과 유해 예측 예측 간의 로짓 통계적 구별 가능성은 딥 네트워크의 근본적 성질이 아니며, 이러한 탐지 방법은 본질적으로 취약함을 시사한다.
- 적응형 훈련을 거쳐도 로짓 기반 탐지기를 강건하게 만들 수 없으며, 이는 로짓 통계가 유해 예측 예측을 신뢰성 있게 탐지하는 데 사용될 수 없다는 것을 의미한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.