Skip to main content
QUICK REVIEW

[논문 리뷰] Mitigating Evasion Attacks to Deep Neural Networks via Region-based Classification

Xiaoyu Cao, Neil Zhenqiang Gong|arXiv (Cornell University)|2017. 09. 17.
Adversarial Robustness in Machine Learning참고 문헌 30인용 수 7
한 줄 요약

이 논문은 테스트 예제를 중심으로 한 초입방정식 내 다수의 점에서의 예측을 앙상블하는 방식으로, 깊이 신경망(DNN)을 오염 공격으로부터 방어하기 위해 영역 기반 분류를 제안한다. 이 방법은 벤치마크 성능에 영향을 주지 않으면서도 최신의 적대적 공격(카를리니와 웨거의 공격 등)에 대해 뛰어난 강건성을 확보하며, 원래 모델의 성능을 유지하면서도 적대적 공격 성공률를 크게 감소시킨다.

ABSTRACT

Deep neural networks (DNNs) have transformed several artificial intelligence research areas including computer vision, speech recognition, and natural language processing. However, recent studies demonstrated that DNNs are vulnerable to adversarial manipulations at testing time. Specifically, suppose we have a testing example, whose label can be correctly predicted by a DNN classifier. An attacker can add a small carefully crafted noise to the testing example such that the DNN classifier predicts an incorrect label, where the crafted testing example is called adversarial example. Such attacks are called evasion attacks. Evasion attacks are one of the biggest challenges for deploying DNNs in safety and security critical applications such as self-driving cars. In this work, we develop new methods to defend against evasion attacks. Our key observation is that adversarial examples are close to the classification boundary. Therefore, we propose region-based classification to be robust to adversarial examples. For a benign/adversarial testing example, we ensemble information in a hypercube centered at the example to predict its label. In contrast, traditional classifiers are point-based classification, i.e., given a testing example, the classifier predicts its label based on the testing example alone. Our evaluation results on MNIST and CIFAR-10 datasets demonstrate that our region-based classification can significantly mitigate evasion attacks without sacrificing classification accuracy on benign examples. Specifically, our region-based classification achieves the same classification accuracy on testing benign examples as point-based classification, but our region-based classification is significantly more robust than point-based classification to various evasion attacks.

연구 동기 및 목표

  • 깊이 신경망(DNN)이 작은 적대적 편향에 의해 잘못 분류되는 오염 공격에 대한 취약성을 해결하기 위해.
  • 실증적 측정을 바탕으로 적대적 예제가 결정 경계 근처에 존재하는지 여부를 조사하기 위해.
  • 재학습이나 원본 DNN 수정 없이도 강건성을 향상시키는 방어 기법을 개발하기 위해.
  • 표준 벤치마크(MNIST 및 CIFAR-10)에서 강력한 적대적 공격 조건 하에서 이 방어 기법을 평가하기 위해.
  • 영역 기반 분류가 벤치마크 예제에서 높은 정확도를 유지하면서도 적대적 공격 성공률를 극적으로 감소시키는지 입증하기 위해.

제안 방법

  • 이 방법은 입력 공간에서 테스트 예제를 중심으로 한 초입방정식 내에서 다수의 변형된 점을 샘플링한다.
  • 초입방정식 내의 각 샘플링된 점에 대해 원본 DNN 분류기가 레이블을 예측한다.
  • 모든 샘플링된 점의 레이블에 대한 다수결 투표를 통해 원래 테스트 예제의 최종 예측을 결정한다.
  • 이 접근 방식은 점 기반 분류를 영역 기반 분류로 전환하며, 입력 공간 내 국소 일관성을 활용한다.
  • 이 방어 기법은 추론 시점에만 적용되므로, 재학습 없이도 기존 모델과 호환된다.
  • 이 방법은 다수의 노이즈가 섞인 샘플을 통해 암묵적인 랜덤화를 적용하지만, 이전의 랜덤화 방어 기법과는 달리 단일 랜덤화 입력이 아닌 다수의 샘플에 대한 앙상블 투표를 사용한다.

실험 결과

연구 질문

  • RQ1적대적 예제는 결정 경계 근처에 위치하여, 그 주변의 국소 영역 내에서도 진짜 클래스에 속하는 점들이 존재하는가?
  • RQ2테스트 예제 주변의 국소 영역 내 다수의 점에서의 예측을 앙상블하면 오염 공격에 대한 강건성이 향상되는가?
  • RQ3영역 기반 분류는 점 기반 분류와 동일한 정확도를 벤치마크 예제에서 유지하는가?
  • RQ4카를리니와 웨거가 제안한 것과 같은 강력한 적대적 공격에 대해 영역 기반 분류는 얼마나 효과적인가?
  • RQ5재학습 없이도 다양한 데이터셋과 공격 유형으로 일반화 가능한가?

주요 결과

  • 영역 기반 분류는 점 기반 분류와 동일한 테스트 정확도를 벤치마크 예제에서 확보하여 성능 저하가 없음을 확인했다.
  • 이 방법은 MNIST 및 CIFAR-10 데이터셋에서 카를리니와 웨거의 공격을 포함한 오염 공격의 성공률을 극적으로 감소시켰다.
  • 강력한 공격으로 생성된 적대적 예제는 작은 편향에 민감한 것으로 밝혀졌으며, 영역 내 샘플링된 점들을 평가할 때 그 레이블이 변하는 경향을 보였다.
  • 적응 공격의 실제 성공률는 추정치보다 낮았는데, 일부 적대적 예제가 과도한 노이즈로 인해 인간의 시각적 인지 가능성 테스트에 통과하지 못했기 때문이다.
  • 이 방어 기법은 적대적 훈련과 정규화를 우회하는 공격에도 강건했으며, 최신 오염 공격 기법에 효과적임을 시사한다.
  • 이 접근 방식은 입력 공간 내 국소 일관성을 활용해 원본 모델을 수정하지 않고도 적대적 예제를 탐지하고 완화할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.