Skip to main content
QUICK REVIEW

[논문 리뷰] A Data Augmentation-based Defense Method Against Adversarial Attacks in Neural Networks

Yi Zeng, Han Qiu|arXiv (Cornell University)|2020. 07. 30.
Adversarial Robustness in Machine Learning참고 문헌 38인용 수 4
한 줄 요약

이 논문은 적대적 공격에 대한 강건성을 향상시키기 위해 입력 이미지에 무작위로 적용되는 애핀 변환(이동, 회전, 스케일링)을 사용하는 경량 데이터 증강 기반 방어 기법인 Stochastic Affine Transformation (SAT)을 제안한다. SAT는 높은 정상 정확도(98%)를 유지하면서 공격 성공률을 거의 0으로 낮추며, 50라운드 BPDA 공격에 대해 80%의 정확도를 달성하여 최신 기법들을 능가한다.

ABSTRACT

Deep Neural Networks (DNNs) in Computer Vision (CV) are well-known to be vulnerable to Adversarial Examples (AEs), namely imperceptible perturbations added maliciously to cause wrong classification results. Such variability has been a potential risk for systems in real-life equipped DNNs as core components. Numerous efforts have been put into research on how to protect DNN models from being tackled by AEs. However, no previous work can efficiently reduce the effects caused by novel adversarial attacks and be compatible with real-life constraints at the same time. In this paper, we focus on developing a lightweight defense method that can efficiently invalidate full whitebox adversarial attacks with the compatibility of real-life constraints. From basic affine transformations, we integrate three transformations with randomized coefficients that fine-tuned respecting the amount of change to the defended sample. Comparing to 4 state-of-art defense methods published in top-tier AI conferences in the past two years, our method demonstrates outstanding robustness and efficiency. It is worth highlighting that, our model can withstand advanced adaptive attack, namely BPDA with 50 rounds, and still helps the target model maintain an accuracy around 80 %, meanwhile constraining the attack success rate to almost zero.

연구 동기 및 목표

  • 실제 환경의 제약 조건을 고려할 때도 효과적인 경량의 모델 무관 방어 기법을 개발하는 것.
  • BPDA와 같은 고급 백색 상자 공격에 실패하는 기존 방어 기법의 한계를 해결하는 것.
  • 기존 경량 기반 공격(FGSM, C&W 등)과 적응형 공격(BPDA 등) 모두에 대해 강건성을 향상시키는 것.
  • 정상 입력에 대해 높은 분류 정확도를 유지하면서 동시에 적대적 편향을 효과적으로 무력화하는 것.

제안 방법

  • SAT는 추론 중 입력 이미지에 대해 이동, 회전, 스케일링의 세 가지 애핀 변환을 무작위로 적용한다.
  • 변환 계수의 무작위화로 인해 확률적 특성이 발생하여, BPDA와 같은 기반에 기반한 공격에서 사용하는 기울기 가정을 깨뜨린다.
  • 이 방어 기법은 아키텍처 변경 없이도 기존의 사전 학습된 DNN 모델과 호환되는 전처리 단계로 작동한다.
  • 이 방법은 경량이면서도 효율적이므로, IoT 기기와 같은 자원 제약 환경에 적합하다.
  • 데이터 증강 원리를 활용하여 입력의 변동성을 증가시켜 적대적 편향이 효과를 잃게 한다.
  • 대상 모델에 관계없이 적용 가능하므로 다양한 DNN 아키텍처에 쉽게 배포할 수 있다.

실험 결과

연구 질문

  • RQ1데이터 증강 기반 방어 기법이 FGSM 및 IFGSM과 같은 표준 적대적 공격을 효과적으로 방어하면서도 높은 정상 정확도를 유지할 수 있는가?
  • RQ2기울기 가로막기를 악용하는 고급 적응형 공격인 BPDA에 대해 이 방어 기법은 얼마나 효과적인가?
  • RQ3애핀 변환의 무작위화가 정상 분류 성능을 떨어뜨리지 않으면서 얼마나 강건성을 향상시키는가?
  • RQ4반복 최적화를 사용하는 완전한 백색 상자 공격 상황에서도 이 방어 기법은 여전히 효과적인가?
  • RQ5이 방어 기법이 도입하는 변동성은 기울기 기반 공격을 막는 데 어떤 정도의 영향을 미치는가?

주요 결과

  • SAT는 FGSM 및 IFGSM 공격에 대해 98%의 정상 정확도를 기록했고, 공격 성공률을 0%로 낮춰 기준 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • C&W 및 LBFGS 공격에 대해서는 각각 85%와 78%의 정확도를 유지했으며, 공격 성공률은 1% 미만이었다.
  • 50라운드 BPDA 공격 상황에서 SAT는 80%의 모델 정확도를 유지했고, 공격 성공률은 0%로 유지되어 모든 이전 방어 기법을 능가했다.
  • 이 방어 기법의 효과성은 $l_2$, SSIM, PSNR로 측정한 원본 이미지와 변환된 이미지 간의 변동성과 강하게 상관관계가 있었다.
  • SAT는 네 가지 최신 기법(FD, SHIELD, BdR, PD)보다 뛰어난 성능을 보였으며, 특히 적응형 공격에 대한 저항력에서 두각을 나타냈다.
  • 이 방법은 경량이면서도 실제 환경의 제약 조건을 고려할 수 있어, IoT 기기와 같은 자원 제약 환경에서의 배포에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.