Skip to main content
QUICK REVIEW

[논문 리뷰] A Black-box Attack on Neural Networks Based on Swarm Evolutionary Algorithm

Xiaolei Liu, Yuheng Luo|arXiv (Cornell University)|2019. 01. 26.
Adversarial Robustness in Machine Learning참고 문헌 37인용 수 5
한 줄 요약

이 논문은 신경망에 대한 블랙박스 적대적 공격을 위한 BANA를 제안한다. 이 방법은 기울기나 모델 아키텍처 지식 없이도 편향을 생성하는 군집 진화 알고리즘을 사용한다. 이 방법은 MNIST와 CIFAR-10에서 평균 L2 편향이 2 미만일 때 100% 공격 성공률를 달성하며, 방어적 분산(Defensive Distillation)을 성공적으로 우회하고, 본질적인 무작위성 덕분에 다양하고 반복되지 않는 적대적 샘플을 생성한다.

ABSTRACT

Neural networks play an increasingly important role in the field of machine learning and are included in many applications in society. Unfortunately, neural networks suffer from adversarial samples generated to attack them. However, most of the generation approaches either assume that the attacker has full knowledge of the neural network model or are limited by the type of attacked model. In this paper, we propose a new approach that generates a black-box attack to neural networks based on the swarm evolutionary algorithm. Benefiting from the improvements in the technology and theoretical characteristics of evolutionary algorithms, our approach has the advantages of effectiveness, black-box attack, generality, and randomness. Our experimental results show that both the MNIST images and the CIFAR-10 images can be perturbed to successful generate a black-box attack with 100\% probability on average. In addition, the proposed attack, which is successful on distilled neural networks with almost 100\% probability, is resistant to defensive distillation. The experimental results also indicate that the robustness of the artificial intelligence algorithm is related to the complexity of the model and the data set. In addition, we find that the adversarial samples to some extent reproduce the characteristics of the sample data learned by the neural network model.

연구 동기 및 목표

  • 모델 기울기, 가중치, 아키텍처에 대한 접근이 필요 없는 블랙박스 적대적 공격을 개발하는 것.
  • 다양한 딥러닝 모델, 특히 DNN 및 CNN에 효과적인 고품질의 눈에 띄지 않는 적대적 샘플을 생성하는 것.
  • 기울기 정보나 전이성 가정에 의존하는 기존 공격의 한계를 극복하는 것.
  • 방어적 분산이라는 주요 방어 메커니즘에 대한 저항력을 평가하는 것.
  • 모델 복잡도, 데이터셋 복잡도, 적대적 저항력 간의 관계를 조사하는 것.

제안 방법

  • 공격는 각각의 편향을 인구집단 내 개체로 간주하고, 오분류 성공률로 정의된 적합도를 최적화하는 군집 진화 알고리즘(Sea)을 사용한다.
  • 적합도 평가는 모델의 블랙박스 쿼리에 의해 수행되며, 기울기 계산이나 모델 구조 지식이 필요 없게 된다.
  • 알고리즘은 전역 및 국지 탐색, 적응형 돌연변이, 빈도 선택 메커니즘을 통해 수렴성과 다양성을 향상시킨다.
  • 편향은 L2 거리 최소화와 동시에 목표 또는 비목표 공격의 오분류 확률 최대화를 위해 반복적으로 진화된다.
  • 이 방법은 ResNet, DenseNet 및 변형된 모델을 포함한 다양한 아키텍처에 일반화 가능하다.
  • 진화 과정의 무작위성 덕분에 동일한 입력에 대해서도 각 실행에서 다른 적대적 샘플이 생성되며, 이는 방어 수단에 대한 저항력을 향상시킨다.

실험 결과

연구 질문

  • RQ1기울기 정보나 모델 아키텍처에 의존하지 않고도 블랙박스 적대적 공격를 구성할 수 있는가?
  • RQ2군집 기반 진화 알고리즘이 다양한 모델에서 높은 성공률와 낮은 눈에 띄는 정도를 가진 적대적 샘플을 생성할 수 있는가?
  • RQ3제안된 공격는 알려진된 강력한 보안 메커니즘인 방어적 분산에 대해 얼마나 효과적인가?
  • RQ4모델 복잡도, 데이터셋 복잡도, 적대적 저항력 간의 관계는 어떠한가?
  • RQ5적대적 편향 패턴은 모델의 결정 경계에서 학습된 특징을 반영하는가?

주요 결과

  • 제안된 BANA 공격는 MNIST 및 CIFAR-10 데이터셋에서 비목표 및 목표 공격 모두 100% 성공률를 기록한다.
  • MNIST에서 평균 L2 편향 크기는 1.26 이하이며, CIFAR-10에서는 2 이하로, 미미하고 눈에 띄지 않는 변화를 의미한다.
  • 99.89%의 성공률로 변형된 모델에서도 공격가능하여, 방어적 분산에 대한 저항성을 입증한다.
  • 스토캐스틱한 군집 알고리즘의 특성 덕분에 런타임 간에 다양한 적대적 샘플이 생성되며, 이는 탐지 회피 능력을 향상시킨다.
  • 모델의 복잡도와 데이터셋의 복잡도가 모두 모델의 적대적 저항력에 영향을 미치며, 더 복잡한 모델일수록 적대적 공격에 더 강하다.
  • 목표 공격에서의 편향 패턴은 원본 숫자와 목표 숫자의 특징과 뚜렷하게 일치하며, 이는 적대적 예제가 학습된 데이터 특성을 반영하고 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.