Skip to main content
QUICK REVIEW

[논문 리뷰] Defending against Backdoor Attack on Deep Neural Networks

Hao Cheng, Kaidi Xu|arXiv (Cornell University)|2020. 02. 26.
Adversarial Robustness in Machine Learning참고 문헌 23인용 수 37
한 줄 요약

Backdoor 공격이 DNN 활성화 패턴을 어떻게 바꾸는지 분석하고, 공격 성공률을 줄이면서 깨끗한 데이터에서의 정확도를 보존하는 L-∞ 기반 뉴런 가지치기 방어를 제안한다.

ABSTRACT

Although deep neural networks (DNNs) have achieved a great success in various computer vision tasks, it is recently found that they are vulnerable to adversarial attacks. In this paper, we focus on the so-called extit{backdoor attack}, which injects a backdoor trigger to a small portion of training data (also known as data poisoning) such that the trained DNN induces misclassification while facing examples with this trigger. To be specific, we carefully study the effect of both real and synthetic backdoor attacks on the internal response of vanilla and backdoored DNNs through the lens of Gard-CAM. Moreover, we show that the backdoor attack induces a significant bias in neuron activation in terms of the $\ell_\infty$ norm of an activation map compared to its $\ell_1$ and $\ell_2$ norm. Spurred by our results, we propose the extit{$\ell_\infty$-based neuron pruning} to remove the backdoor from the backdoored DNN. Experiments show that our method could effectively decrease the attack success rate, and also hold a high classification accuracy for clean images.

연구 동기 및 목표

  • Grad-CAM을 사용하여 일반 DNN과 백도어가 적용된 DNN이 백도어 트리거에 어떻게 반응하는지 특성화한다.
  • p-노름을 통해 뉴런 활성화 패턴을 정량적으로 분석하여 견고한 방어 기준을 식별한다.
  • L-infinity 노름 기반의 뉴런 가지치기 방법을 제안하고 백도어 효과를 완화하는지 평가한다.
  • 교통 표지판 데이터셋에서 공격 억제와 깨끗한 정확도 간의 트레이드오프를 보여준다.

제안 방법

  • 깨끗한 입력과 트리거된 입력에서 일반 DNN과 백도어 DNN의 판별적 영역을 Grad-CAM으로 시각화한다.
  • 최종 합성곱 계층의 뉴런 활성화 맵을 계산하고 입력 조건별로 L1, L2, L-infinity 노름을 비교한다.
  • 트리거 역공학을 통해 백도어 트리거를 합성하고 네 가지 입력 조건(clean, clean+ori, clean+syn, clean+ori+syn)을 평가한다.
  • L-infinity 노름이 깨끗한 경우와 트리거가 적용된 경우 간의 가장 강한 차이를 보임을 확인한다.
  • 트리거로 인한 예측을 억제하기 위해 높은 L-infinity 활성화를 가진 뉴런에 가지치를 적용한다.
  • AlexNet을 사용하여 German Traffic Sign Recognition Benchmark에서 가지치를 평가하고 정확도와 공격 성공률을 보고한다.

실험 결과

연구 질문

  • RQ1Grad-CAM이 일반 DNN과 백도어 DNN이 백도어 트리거에 어떻게 반응하는지 차이를 드러낼 수 있는가?
  • RQ2어떤 활성화 노름 지표가 깨끗한 활성화와 트리거가 적용된 활성화를 가장 잘 구분하는가?
  • RQ3L-infinity 기반 뉴런 가지치기가 깨끗한 정확도를 보존하면서 백도어 공격 성공률을 효과적으로 감소시키는가?
  • RQ4방어 강도와 깨끗한 데이터에서의 모델 성능 간의 트레이드오프는 무엇인가?

주요 결과

  • 백도어가 적용된 DNN은 트리거가 존재할 때 트리거 영역에 집중된 판별 가능한 활성화를 보인다.
  • 최종 계층 활성화의 L-infinity 노름이 깨끗한 입력과 트리거된 입력 간의 차이를 L1, L2에 비해 가장 크게 보인다.
  • L-infinity 기반 가지치기는 깨끗한 정확도 손실은 미미하게 줄이면서 공격 성공률을 81.61%에서 42.99~48.42%로 낮춘다.
  • 최적의 가지치기 임계치는 깨끗한 정확도가 최소로 하락하는 한편 공격 성공이 크게 감소하는 균형을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.