[논문 리뷰] AdvKnn: Adversarial Attacks On K-Nearest Neighbor Classifiers With Approximate Gradients
이 논문은 k-최근접 이웃(kNN) 및 딥 k-최근접 이웃(DkNN) 분류기용 새로운 적대적 공격 방법인 AdvKNN을 제안한다. 이 방법은 kNN 출력을 기울기를 통해 근사화할 수 있는 미분 가능 딥 kNN 블록(DkNNB)을 사용하여 기울기 기반 공격를 가능하게 한다. 또한, 분포 기반 방어에 대한 강건성을 향상시키기 위해 확률 분포에 기반한 일관성 학습을 도입하여, 이전 작업보다 훨씬 작은 변형으로 더 높은 공격 성공률을 달성한다.
Deep neural networks have been shown to be vulnerable to adversarial examples---maliciously crafted examples that can trigger the target model to misbehave by adding imperceptible perturbations. Existing attack methods for k-nearest neighbor~(kNN) based algorithms either require large perturbations or are not applicable for large k. To handle this problem, this paper proposes a new method called AdvKNN for evaluating the adversarial robustness of kNN-based models. Firstly, we propose a deep kNN block to approximate the output of kNN methods, which is differentiable thus can provide gradients for attacks to cross the decision boundary with small distortions. Second, a new consistency learning for distribution instead of classification is proposed for the effectiveness in distribution based methods. Extensive experimental results indicate that the proposed method significantly outperforms state of the art in terms of attack success rate and the added perturbations.
연구 동기 및 목표
- kNN 및 DkNN 분류기는 본질적으로 비미분 가능하므로 기울기 기반 적대적 공격에 저항하는 점을 해결하기 위해.
- 작은 왜곡으로 적대적 예제를 생성하기 위한 기울기 기반 최적화를 가능하게 하는 kNN 출력의 미분 가능 근사치를 개발하기 위해.
- 다중 레이어에서 예측을 집계하고 신뢰도 점수를 방어 수단으로 사용하는 DkNN 모델의 공격 효과를 향상시키기 위해, 레이블이 아닌 확률 분포에 기반한 일관성 학습 방법을 도입하기 위해.
- 특히 변형 크기와 탐지 가능성 측면에서 실제 적대적 조건에서 kNN 기반 방어의 강건성을 평가하기 위해.
제안 방법
- kNN 분류기의 출력 확률 분포를 근사화하는 미분 가능 딥 kNN 블록(DkNNB)을 제안하여, 적대적 공격 생성을 위한 기울기 계산을 가능하게 한다.
- 클래스 레이블이 아닌 확률 분포를 기반으로 다중 레이어 간 예측을 일치시키는 일관성 학습(CL) 프레임워크를 도입하여, DkNN 모델의 공격 강건성을 향상시킨다.
- DkNNB와 CL을 표준 기울기 기반 공격(FGSM 및 BIM)과 결합하여 최소한의 왜곡으로 적대적 예제를 생성한다.
- 변형 크기를 측정하기 위해 L∞ 및 L2 노름을 사용하고, 공격 성공률, 정확도 감소 및 신뢰도 점수를 평가하여 성능 및 탐지 가능성 평가를 수행한다.
- 다중 레이어 특징 추출 전략을 활용하여 네트워크의 다양한 레이어에 DkNNB를 적용하여 이동성 및 레이어별 공격 효과를 평가한다.
- 표준 DNN 및 kNN 기반 모델(레이어별 집계 기반 DkNN 포함)을 사용하여 MNIST, SVHN 및 Fashion-MNIST 데이터셋에서 방법을 검증한다.
실험 결과
연구 질문
- RQ1기울기 기반 적대적 공격를 가능하게 하기 위해 비미분 가능한 kNN 분류기에 대해 기울기 기반 근사치를 구성할 수 있는가?
- RQ2다중 레이어에서 예측을 집계하는 DkNN 모델에서, 레이블이 아닌 확률 분포에 기반한 일관성 학습이 공격 성공률 향상에 얼마나 효과적인가?
- RQ3DkNN 모델을 속이기 위해 필요한 최소 변형은 얼마이며, L2 왜곡 및 공격 성공률 측면에서 이전 최첨단 기법과 비교해 볼 때 어떻게 되는가?
- RQ4DkNN 모델에서 일반적인 방어 수단인 신뢰도 점수 기반 필터링을 사용할 때, AdvKNN에 의해 생성된 적대적 예제는 탐지될 수 있는가?
- RQ5특히, LeNet5와 같은 표준 DNN 모델로의 이동성은 어떻게 되는가? 특히, 제안된 방법을 사용해 생성된 적대적 예제의 경우 어떻게 되는가?
주요 결과
- 제안된 AdvKNN 방법은 L∞ 노름 하에서 MNIST에서 DkNN 정확도를 5.71%로 감소시켰고, 평균 L2 왜곡은 1.4909였으며, 이는 이전 작업이 달성한 17.44% 정확도와 3.476 왜곡보다 뚜렷이 뛰어나다.
- 일관성 학습(CL)을 추가함으로써 DkNN에 대한 공격 성공률가 더욱 향상되었으며, BIM을 사용할 경우 Fashion-MNIST에서 정확도는 7.54%로 감소하고 평균 L2 왜곡은 1.4909였다.
- DkNNB와 CL을 결합한 FGSM를 사용할 경우, MNIST에서 kNN의 공격 성공률는 98.98%에 달했고, 정확도는 98.98%에서 15.28%로 감소했다.
- AdvKNN에 의해 생성된 적대적 예제는 DkNN의 신뢰도 기반 필터링을 통해 탐지하기 어려운 정도로 더 높은 신뢰도 점수(0.4608)를 기록했으며, 이는 이전 방법(0.1037)보다 높은 수준이다.
- LeNet5에서의 이동성 실험 결과, AdvKNN에 의해 생성된 적대적 예제는 표준 FGSM 및 BIM 공격를 능가했으며, FGSM 하에서 DkNN 정확도는 75.70%였고, 정상 모델은 81.41%였다.
- 절단 실험을 통해 DkNNB가 모든 레이어에서 효과적이며, 특히 레이어 3에서 가장 우수한 성능를 보였고, k 값이 크더라도 높은 성공률를 유지함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.