[논문 리뷰] Detection based Defense against Adversarial Examples from the Steganalysis Point of View
이 논문은 스테고그래피 분석 기반의 방어 기법을 제안하며, 수정 확률 추정(MPM)을 통해 스테고그래피 특징을 강화하여 C&W 공격과 같은 강력한 공격에 대해 ImageNet에서 최대 93.41%의 높은 정확도를 달성한다. 비신경망 아키텍처를 통해 2차 공격에 저항할 수 있어, 신경망 기반 방식에 비해 우수한 안정성을 확보한다.
Deep Neural Networks (DNNs) have recently led to significant improvements in many fields. However, DNNs are vulnerable to adversarial examples which are samples with imperceptible perturbations while dramatically misleading the DNNs. Moreover, adversarial examples can be used to perform an attack on various kinds of DNN based systems, even if the adversary has no access to the underlying model. Many defense methods have been proposed, such as obfuscating gradients of the networks or detecting adversarial examples. However it is proved out that these defense methods are not effective or cannot resist secondary adversarial attacks. In this paper, we point out that steganalysis can be applied to adversarial examples detection, and propose a method to enhance steganalysis features by estimating the probability of modifications caused by adversarial attacks. Experimental results show that the proposed method can accurately detect adversarial examples. Moreover, secondary adversarial attacks cannot be directly performed to our method because our method is not based on a neural network but based on high-dimensional artificial features and FLD (Fisher Linear Discriminant) ensemble.
연구 동기 및 목표
- 깊이 신경망이 시각적으로 인식되지 않지만 모델을 오류로 이끄는 악성 예측 예측값에 대한 취약성을 해결하기 위해.
- 특히 신경망을 사용한 탐지 기반 방어 기법이 2차 공격에 취약한 점을 해결하기 위해.
- 스테고그래피에서 숨겨진 데이터 수정과 유사한 악성 예측 변형을 탐지하기 위해 스테고그래피를 새로운 패러다임으로 활용해보기 위해.
- 다양한 악성 예측 공격 유형에 걸쳐 스테고그래피 기반 탐지 성능을 향상시키기 위한 특징 강화 기법(MPM)을 개발하기 위해.
- 탐지 파이프라인에서 신경망 아키텍처를 회피함으로써 2차 공격에 강건한 탐지 시스템을 설계하기 위해.
제안 방법
- 이 방법은 이미지의 변형을 숨겨진 수정으로 모델링함으로써 스테고그래피 원리를 적용해 악성 예측 예측값을 탐지한다.
- 악성 예측 공격로 인한 픽셀 변경 확률을 추정하기 위해 수정 확률 추정(MPM) 기법을 도입하여 스테고그래피 특징을 강화한다.
- 고차원의 인공 특징과 피셔 선형 판별(FLD) 앙상블을 결합해 분류를 수행한다.
- VGG-16 분류기 기반 ImageNet-1000 데이터셋을 대상으로 FGSM, IGSM, Deepfool, C&W 공격 유형 4종에 대해 성능을 평가한다.
- MPM가 포함된 탐지기와 포함되지 않은 탐지기(예: SPAM 대비 ESPAM, SRM 대비 ESRM)를 비교하여 특징 강화의 효과를 검증한다.
- 탐지 모델이 명시적으로 비신경망 구조를 취함으로써 신경망 기반 탐지기에서 흔히 발생하는 2차 공격에 대한 취약성을 피한다.
실험 결과
연구 질문
- RQ1스테고그래피 기법을 악성 예측 예측값 탐지에 효과적으로 적용할 수 있는가? 즉, 변형을 숨겨진 데이터 수정으로 간주할 수 있는가?
- RQ2수정 확률 추정(MPM)은 다양한 악성 예측 공격에 걸쳐 스테고그래피 특징을 어떻게 향상시켜 탐지 정확도를 높이는가?
- RQ3비신경망 기반 탐지 모델은 신경망 기반 탐지기의 취약점을 악용하는 2차 공격에 저항할 수 있는가?
- RQ4MPM로 강화된 탐지기의 성능은 기존 방어 기법과 비교해 강력한 공격(예: ImageNet에서의 C&W)에 대해 어떻게 나타나는가?
- RQ5MPM를 적용한 저차원 특징 탐지기의 성능은 고차원 특징 탐지기와 유사한가?
주요 결과
- MPM를 적용한 ESRM 탐지기는 ImageNet에서 C&W 공격에 대해 93.41%의 탐지 정확도를 기록하며 기존 기반 기법을 크게 능가했다.
- SPAM에 대해 MPM 적용으로 정확도가 15% 이상 향상되어 강력한 특징 강화 능력을 입증했다.
- ESPM 및 ESRM은 RBF-SVM보다 뛰어난 성능을 보였으며, C&W 공격에 대해 거의 무용지물이었던 RBF-SVM(정확도 51.87%)에 비해 유의미한 개선을 이뤘다.
- ESRM 탐지기는 FGSM, IGSM, Deepfool, C&W를 포함한 모든 공격 유형에 대해 평균 탐지 정확도가 가장 높았다.
- MPM가 적용된 탐지기들은 MPM 미적용 대비 일관되게 높은 정확도를 기록하여 강화 기법의 효과를 확인했다.
- 탐지 모델의 비신경망 아키텍처는 직접적인 2차 공격에 취약하지 않아 신경망 기반 방어 기법에 비해 핵심적인 이점을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.