Skip to main content
QUICK REVIEW

[논문 리뷰] Boosting Gradient for White-Box Adversarial Attacks

Hongying Liu, Zhenyu Zhou|arXiv (Cornell University)|2020. 10. 21.
Adversarial Robustness in Machine Learning참고 문헌 27인용 수 10
한 줄 요약

이 논문은 백프로파게이션 중 ReLU 활성화 함수에서 발생하는 두 가지 그래디언트 오류 방향 문제인 '틀린 차단'(wrong blocking)과 '과도 전달'(over-transmission)을 수정함으로써, 기반 그래디언트 기반 화이트박스 적대적 공격의 성능을 향상시키는 새로운 방법 ADV-ReLU를 제안한다. 점수 기반 선택과 적응형 임계값 설정을 통해 그래디언트 계산을 정밀하게 다듬음으로써, ℓ₂-노름 노이즈를 감소시키고 전이 가능성(transferability)을 향상시켜, ImageNet에서 Inception-v4로 전이될 경우 기준 공격 대비 최대 7.0% 높은 성공률을 기록한다.

ABSTRACT

Deep neural networks (DNNs) are playing key roles in various artificial intelligence applications such as image classification and object recognition. However, a growing number of studies have shown that there exist adversarial examples in DNNs, which are almost imperceptibly different from original samples, but can greatly change the network output. Existing white-box attack algorithms can generate powerful adversarial examples. Nevertheless, most of the algorithms concentrate on how to iteratively make the best use of gradients to improve adversarial performance. In contrast, in this paper, we focus on the properties of the widely-used ReLU activation function, and discover that there exist two phenomena (i.e., wrong blocking and over transmission) misleading the calculation of gradients in ReLU during the backpropagation. Both issues enlarge the difference between the predicted changes of the loss function from gradient and corresponding actual changes, and mislead the gradients which results in larger perturbations. Therefore, we propose a universal adversarial example generation method, called ADV-ReLU, to enhance the performance of gradient based white-box attack algorithms. During the backpropagation of the network, our approach calculates the gradient of the loss function versus network input, maps the values to scores, and selects a part of them to update the misleading gradients. Comprehensive experimental results on \emph{ImageNet} demonstrate that our ADV-ReLU can be easily integrated into many state-of-the-art gradient-based white-box attack algorithms, as well as transferred to black-box attack attackers, to further decrease perturbations in the ${\ell _2}$-norm.

연구 동기 및 목표

  • 딥 네ural 네트워크에서 백프로파게이션 과정에서 그래디언트 계산을 왜곡시키는 ReLU 활성화 함수의 간과된 역할을 다루기 위해.
  • 적대적 공격 품질을 떨어뜨리는 두 가지 특정 그래디언트 오류 방향 현상인 '틀린 차단'과 '과도 전달'을 식별하고 수정하기 위해.
  • 기존의 그래디언트 기반 화이트박스 공격 알고리즘에 아키텍처 변경 없이도 적용 가능한 유니버설 플러그인 프레임워크를 개발하기 위해.
  • 다양한 네트워크 아키텍처, 특히 블랙박스 환경에서의 적대적 예제의 강건성과 전이 가능성 향상시키기 위해.

제안 방법

  • ADV-ReLU는 뉴런 중요도를 평가하기 위해 점수 기반 매핑을 사용하여 ReLU를 통한 그래디언트 재계산를 통해 백프로파게이션 과정을 수정한다.
  • 입력 값과 유전된 그래디언트 사이의 균형을 맞추기 위해 제약 상수 $ c $ 를 도입하여 ReLU의 도함수로 인한 오류 방향을 감소시킨다.
  • 정렬 비율 $ s $ 는 최상위 활성화 뉴런의 비율을 제어하여 정밀도와 노이즈 사이의 트레이드오���을 최적화한다.
  • 이 방법은 두 단계의 그래디언트 보정을 적용한다: ADV-ReLU-B는 편향 보정을 위해, ADV-ReLU-T는 그래디언트 전달 개선을 위해 사용된다.
  • 이 프레임워크는 기존의 화이트박스 공격 알고리즘(예: I-FGSM 및 MI-FGSM)에 쉽게 통합할 수 있도록 유니버설 모듈로 설계되었다.
  • 부드럽고 그래디언트 유도의 노이즈 경로를 확보하기 위해 적응형 스텝 크기 $ \alpha = 0.001 $ 를 사용한다.

실험 결과

연구 질문

  • RQ1ReLU 활성화 함수의 도함수 특성이 적대적 공격의 백프로파게이션 과정에서 그래디언트 계산을 어떻게 오류 방향으로 이끄는가?
  • RQ2ReLU에서 '틀린 차단'과 '과도 전달'을 수정함으로써 적대적 예제의 품질은 얼마나 향상될 수 있는가?
  • RQ3I-FGSM 및 MI-FGSM 등 다양한 화이트박스 공격 알고리즘에 효과적으로 통합될 수 있는 유니버설 그래디언트 보정 프레임워크인 ADV-ReLU는 노이즈 크기를 줄이는 데 성공할 수 있는가?
  • RQ4향상된 그래디언트 일관성이 블랙박스 모델로의 적대적 예제 전이 가능성에 어떤 영향을 미치는가?

주요 결과

  • ADV-ReLU는 다양한 모델에서 화이트박스 공격의 ℓ₂-노름 노이즈를 감소시켰으며, 특히 Inception-v4에서 가장 뚜렷한 개선 효과를 보였다.
  • I-FGSM과 함께 사용했을 때, ADV-ReLU는 Inception-v4에서 기준 공격 대비 공격 성공률을 7.0% 향상시켜 전이 가능성 향상을 입증했다.
  • 정렬 비율 $ s $ 의 최적 범위는 [0.01, 0.03] 내에 있었으며, ResNet101과 같은 잔차 네트워크에서는 높은 값에서 성능 저하가 관찰되었다.
  • 제약 상수 $ c > 0.1 $ 는 성능을 안정화시켜, 더 높은 임계값이 그래디언트 일관성을 향상시키고 오류 방향을 감소시킨다는 것을 시사했다.
  • 작은 스텝 크기(예: $ \alpha = 0.001 $) 는 부드럽고 정확한 그래디언트 경로를 허용함으로써 ADV-ReLU의 효과를 높였다.
  • ADV-ReLU-B와 ADV-ReLU-T 서브 알고리즘은 각각 다른 행동을 보였다: ADV-ReLU-B는 잔차 네트워크에서 파arameter 조정에 더 민감했고, ADV-ReLU-T는 비잔차 아키텍처에서 그래디언트 전달을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.