Skip to main content
QUICK REVIEW

[논문 리뷰] Improved Detection of Adversarial Images Using Deep Neural Networks

Yutong Gao, Yi Pan|arXiv (Cornell University)|2020. 07. 10.
Adversarial Robustness in Machine Learning참고 문헌 21인용 수 6
한 줄 요약

이 논문은 다양한 공격 유형에 걸쳐 적대적 이미지를 탐지하기 위해 중간 특징 맵에 위너 필터링을 적용하는 경량 방어 방법인 특징 맵 노이즈 제거를 제안한다. 이 방법은 재학습이 필요 없이 사전 훈련된 어떤 딥 네ural 네트워크(DNN)에 적용해도 높은 탐지 정확도를 달성하며, 계산 비용도 최소화한다.

ABSTRACT

Machine learning techniques are immensely deployed in both industry and academy. Recent studies indicate that machine learning models used for classification tasks are vulnerable to adversarial examples, which limits the usage of applications in the fields with high precision requirements. We propose a new approach called Feature Map Denoising to detect the adversarial inputs and show the performance of detection on the mixed dataset consisting of adversarial examples generated by different attack algorithms, which can be used to associate with any pre-trained DNNs at a low cost. Wiener filter is also introduced as the denoise algorithm to the defense model, which can further improve performance. Experimental results indicate that good accuracy of detecting the adversarial examples can be achieved through our Feature Map Denoising algorithm.

연구 동기 및 목표

  • 고정밀 응용 분야에서 딥 네럴 네트워크(DNN)의 적대적 예제에 대한 취약성을 해결한다.
  • 재학습 없이도 어떤 사전 훈련된 DNN에나 일반적으로 적용 가능한 방어 기법을 개발한다.
  • FGSM, PGD, AutoAttack와 같은 다양한 적대적 공격 알고리즘에 대해 탐지 정확도를 향상시킨다.
  • 계산 비용을 최소화하면서도 혼합된 적대적 데이터셋에서 높은 탐지 정확도를 유지한다.

제안 방법

  • 사전 훈련된 DNN의 중간 특징 맵에 적용하는 후처리 기법으로 특징 맵 노이즈 제거를 제안한다.
  • 적대적 편향이 종종 고주파 노이즈를 유발하므로, 특징 맵을 노이즈 제거하기 위해 위너 필터를 적용한다.
  • 원본 특징 맵과 복원된 특징 맵 간의 재구성 오차를 적대적 입력의 탐지 점수로 사용한다.
  • 모델의 미세조정이나 재학습 없이 추론 시점에 플러그인 모듈로 통합한다.
  • 재구성 오차를 기반으로 자연 입력과 적대적 입력을 구분하는 단순한 분류기 모델을 훈련한다.
  • 다양한 공격 알고리즘에서 유도된 적대적 예제를 포함하는 혼합 데이터셋에서 방법을 평가한다.

실험 결과

연구 질문

  • RQ1재학습 없이 아키텍처에 종속되지 않는 경량 기법이 다양한 공격 유형에 걸쳐 적대적 예제를 탐지할 수 있는가?
  • RQ2특징 맵 재구성 기반으로 위너 필터링이 자연 입력과 적대적 입력을 얼마나 효과적으로 구분하는가?
  • RQ3평가 시점에 사용되지 않은 새로운 공격에 대해 특징 맵 노이즈 제거가 얼마나 잘 일반화되는가?
  • RQ4제안된 방법에서 탐지 정확도와 계산 비용 간의 상호 상충 관계는 어떠한가?
  • RQ5최소한의 수정으로 어떤 사전 훈련된 DNN에나 효과적으로 적용될 수 있는가?

주요 결과

  • 특징 맵 노이즈 제거는 여러 공격 알고리즘에서 유도된 적대적 예제가 혼합된 데이터셋에서 높은 탐지 정확도를 달성한다.
  • 공격 유형 간에 잘 일반화되며, FGSM, PGD, AutoAttack와 같은 공격에 대해 공격 유형에 맞는 튜닝 없이도 효과적이다.
  • 위너 필터링은 특징 맵 내 적대적 노이즈를 효과적으로 억제함으로써 탐지 성능을 크게 향상시킨다.
  • 계산 비용이 극히 적어 자원 제약이 있는 환경에서 실시간 구현에 적합하다.
  • 공격 강도가 변할 때조차도 재구성 오차 기반 탐지 메커니즘이 강건하고 효과적이다.
  • 다양한 사전 훈련된 DNN에 적용했을 때도 높은 정확도를 유지하여 강력한 전이 가능성과 호환성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.