[논문 리뷰] Exploring the Back Alleys: Analysing The Robustness of Alternative Neural Network Architectures against Adversarial Attacks
이 논문은 원시 이미지 공간에서 대체 신경망 아키텍처—특히 스파iking 신경망(SNNs)과 확률적 인공신경망(ANNs)의 적대적 로버스트성을 조사한다. 백색 상자 공격인 BIM과 같은 단순한 공격에 대해 확률적 ANNs는 취약하지만, 특히 경계 공격과 전이 공격에 대해 블랙박스 환경에서 향상된 로버스트성을 보인다. 본 연구는 확률적 모델을 대상으로 한 블랙박스 공격을 향상시키기 위해 변동성 모방(VM) 대체 학습 기법을 제안하며, 확률적 모델 앙상블이 적대적 예측에 대해 부분적으로 강화된 네트워크를 만들 수 있음을 보여준다.
We investigate to what extent alternative variants of Artificial Neural Networks (ANNs) are susceptible to adversarial attacks. We analyse the adversarial robustness of conventional, stochastic ANNs and Spiking Neural Networks (SNNs) in the raw image space, across three different datasets. Our experiments reveal that stochastic ANN variants are almost equally as susceptible as conventional ANNs when faced with simple iterative gradient-based attacks in the white-box setting. However we observe, that in black-box settings, stochastic ANNs are more robust than conventional ANNs, when faced with boundary attacks, transferability and surrogate attacks. Consequently, we propose improved attacks and defence mechanisms for stochastic ANNs in black-box settings. When performing surrogate-based black-box attacks, one can employ stochastic models as surrogates to observe higher attack success on both stochastic and deterministic targets. This success can be further improved with our proposed Variance Mimicking (VM) surrogate training method, against stochastic targets. Finally, adopting a defender's perspective, we investigate the plausibility of employing stochastic switching of model mixtures as a viable hardening mechanism. We observe that such a scheme does provide a partial hardening.
연구 동기 및 목표
- 원시 이미지 공간에서 SNNs와 확률적 ANNs의 적대적 공격에 대한 로버스트성을 평가하기 위해.
- 기존 ANNs와 비교해 신경망 내부의 확률성이 적대적 공격에 대해 본질적으로 로버스트성을 향상시키는지 조사하기 위해.
- 특히 대체 모델을 사용하는 방식으로 확률적 ANNs를 공격하는 데 더 효과적인 블랙박스 공격 전략을 개발하기 위해.
- 적대적 공격에 대비해 추론 과정에서 다양한 확률적 네트워크를 랜덤으로 전환하는 방식의 확률적 모델 혼합 전략이 방어 수단으로서의 가능성을 탐색하기 위해.
- 결정론적 모델과 확률적 모델 간에 다양한 공격 유형(화이트박스, 블랙박스, 대체 기반 공격)의 성능을 비교하기 위해.
제안 방법
- 적성 로버스트성 평가를 위한 종합적 분석을 위해 MNIST, CIFAR-10, PCam 세 가지 데이터셋을 사용한다.
- SNNs(MCSEFRON 및 $SNN_{m}$)와 확률적 ANNs(BSN 및 BNN)와 비교하기 위해 기준 모델로 보편적인 ResNet18을 사용한다.
- FGSM, CWL2, BIM 등의 화이트박스 공격을 적용하며, 이전 연구에서 영감을 얻은 개선된 목적 함수를 사용한다.
- 확률적 대체 모델을 사용한 대체 기반 블랙박스 공격을 설계 및 구현하며, 대상 모델의 확률적 행동을 더 잘 반영하기 위해 변동성 모방(VM)을 도입한다.
- 추론 과정에서 서로 다른 확률적 네트워크를 랜덤으로 전환하는 방식의 확률적 모델 혼합 방어 전략을 제안한다.
- 로짓과 변동성에 기반한 t-SNE를 사용해 결정 경계를 시각화하여, 확률성이 모델의 로버스트성에 미치는 영향을 분석한다.
실험 결과
연구 질문
- RQ1화이트박스 및 블랙박스 공격 환경에서 SNNs와 확률적 ANNs가 기존 ANNs에 비해 적대적 로버스트성 측면에서 어떻게 비교되는가?
- RQ2네트워크의 가중치나 활성화에서 발생하는 확률성이 적대적 공격에 대해 얼마나 로버스트성을 향상시키는가?
- RQ3대체 기반 블랙박스 공격이 확률적 ANNs에 대해 더 효과적으로 작용할 수 있는가? 만약 그렇다면, 대체 학습 방식은 어떻게 개선될 수 있는가?
- RQ4추론 과정에서 확률적 모델 혼합을 사용하는 것이 적대적 예측에 대한 실질적인 방어 수단이 될 수 있는가?
- RQ5결정 경계의 변동성이 확률적 네트워크에서 성공적인 적대적 예측를 만드는 데 어려움을 초래하는 데 어떤 역할을 하는가?
주요 결과
- 화이트박스 환경에서는 확률적 ANNs(BSN 및 BNN)가 기존 ANNs와 마찬가지로 BIM과 같은 단순 반복 공격에 거의 취약함을 확인하여, 강력한 기울기 기반 공격에 대해 제한된 로버스트성을 보임을 시사한다.
- 블랙박스 환경에서는 확률적 ANNs가 경계 공격과 전이 기반 공격에 대해 훨씬 더 높은 로버스트성을 보이며, 이는 확률성이 전이 가능성의 흐름을 방해하기 때문임을 시사한다.
- 대체 기반 공격는 블랙박스 공격 중 가장 높은 공격 성공률(ASR)을 기록하며, 특히 변동성 모방(VM)을 사용해 학습된 확률적 대체 모델을 사용할 경우 목표 모델의 성능 향상이 이루어짐을 확인하였다.
- 제안된 변동성 모방(VM) 기법은 대상 모델의 확률적 행동을 더 잘 포착함으로써 대체 학습을 향상시키며, 테스트된 모든 블랙박스 공격에서 가장 높은 ASR를 기록하였다.
- 추론 과정에서 서로 다른 확률적 네트워크를 랜덤으로 전환하는 방식의 확률적 모델 앙상블은 공격 성공률(ASR)을 감소시켜, 적대적 예측에 대해 부분적으로 강화된 네트워크임을 입증하였다.
- t-SNE 시각화 결과는 확률적 네트워크가 노이즈가 많고, 더 가시적인, 그리고 높은 변동성 영역이 겹치는 결정 경계를 보이며, 이는 경계 공격 및 전이 공격에 대한 저항성의 이유를 설명한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.