Skip to main content
QUICK REVIEW

[논문 리뷰] Enhancing Gradient-based Attacks with Symbolic Intervals

Shiqi Wang, Yizheng Chen|arXiv (Cornell University)|2019. 06. 05.
Adversarial Robustness in Machine Learning참고 문헌 37인용 수 11
한 줄 요약

이 논문은 입력 주변의 더 넓고 더 유망한 영역을 식별하기 위해 기호적 구간 전파를 활용하는 새로운 기울기 기반 방법인 구간 공격(interval attacks)을 소개한다. 보다 정보적인 기울기를 생성하기 위해 철학적 초과근사 경계를 사용함으로써, 이 방법은 최신의 적대적 훈련된 모델, 특히 MadryLab 챌린지에서 최고 성능을 기록한 MNIST 모델에서 PGD보다 47% 높은 적대적 성공률를 달성한다.

ABSTRACT

Recent breakthroughs in defenses against adversarial examples, like adversarial training, make the neural networks robust against various classes of attackers (e.g., first-order gradient-based attacks). However, it is an open question whether the adversarially trained networks are truly robust under unknown attacks. In this paper, we present interval attacks, a new technique to find adversarial examples to evaluate the robustness of neural networks. Interval attacks leverage symbolic interval propagation, a bound propagation technique that can exploit a broader view around the current input to locate promising areas containing adversarial instances, which in turn can be searched with existing gradient-guided attacks. We can obtain such a broader view using sound bound propagation methods to track and over-approximate the errors of the network within given input ranges. Our results show that, on state-of-the-art adversarially trained networks, interval attack can find on average 47% relatively more violations than the state-of-the-art gradient-guided PGD attack.

연구 동기 및 목표

  • 강력한 신경망에서 적대적 예제를 탐색할 때 기울기 기반 공격가 지역 최적점에 갇히는 데서 비롯되는 한계를 해결하기 위해.
  • 표준 1차 공격인 PGD가 모든 적대적 예제를 찾지 못할 경우, 적대적 훈련된 모델이 실제로 알려지지 않은 공격에 대해 강건한지 조사하기 위해.
  • 기존 기울기 기반 공격과 함께 철학적 경계 전파를 통합하여 더 넓은 탐색 공간을 탐색할 수 있는 일반적인 공격 프레임워크를 개발하기 위해.
  • 최신의 적대적 훈련된 모델, 특히 MadryLab MNIST 챌린지의 모델들에 대해 구간 공격의 효과성을 평가하기 위해.

제안 방법

  • 이 방법은 기호적 구간 분석—철학적 경계 전파 기법—을 사용하여 주어진 입력 변형 영역에서 신경망의 출력 범위를 초과근사한다.
  • 기호적 구간 표현에서 구간 기울기를 추출하여, 기존 기울기보다 손실 표면의 더 넓은 시각을 제공한다.
  • 구간 기울기는 지역 최소값에 갇히는 기존 PGD를 피하기 위해 적대적 예제가 더 많을 잠재력이 있는 영역으로 탐색을 이끈다.
  • 공격는 두 단계 과정을 수행한다: 첫째, 구간 기울기를 사용해 유망한 시작점을 식별한다; 둘째, 정밀한 적대적 예제를 찾기 위해 강력한 기울기 기반 공격(예: PGD)을 적용한다.
  • 반복 과정에서 초과근사 오차와 탐색 효율성의 균형을 맞추기 위해 동적 범위 조정 전략을 사용한다.
  • 이 프레임워크는 기호적 구간 외의 다른 철학적 경계 전파 방법에도 적용 가능하다.

실험 결과

연구 질문

  • RQ1구간 공격는 적대적 훈련된 모델에서 기존 기울기 기반 공격인 PGD보다 적대적 예제를 더 잘 찾을 수 있는가?
  • RQ2기호적 구간 전파를 사용하면 지역 최적점에서 벗어나는 데 도움이 되는 더 넓고 정보가 풍부한 기울기를 제공하는가?
  • RQ3구간 공격는 가장 강력한 모델, 예를 들어 MadryLab MNIST 챌린지의 모델에서 얼마나 효과적인가?
  • RQ4구간 공격는 강건하다고 주장되는 모델에서 이전에 발견되지 않은 취약점을 드러낼 수 있는가?
  • RQ5PGD와 비교할 때, 구간 공격를 사용한 적대적 훈련의 계산 비용과 수렴 행동은 어떠한가?

주요 결과

  • 세 개의 적대적 훈련된 MNIST 모델에서, 구간 공격는 PGD 공격보다 평균적으로 47% 더 많은 적대적 예제를 발견했다.
  • MadryLab MNIST 챌린지 모델—지금까지 MNIST에서 가장 강력한 모델—에서, 구간 공격는 모든 기존 공격 중에서 가장 높은 성공률를 기록했다.
  • 구간 공격의 손실 분포는 많은 고가치의 위반 사례를 보였지만, PGD와 CW 공격는 낮은 손실, 쉽게 찾을 수 있는 예제에 집중했다.
  • MNIST_FC1과 MNIST_FC2에서 20회 반복만으로도 구간 공격는 PGD 대비 38%에서 61%의 상대적 성공률 향상을 달성했다.
  • 구간 공격를 사용한 적대적 훈련은 PGD 기반 훈련보다 훨씬 느리고 효율성이 떨어졌으며, 작은 MNIST 네트워크에서 80%의 강건성 정확도에 도달하는 데 PGD보다 47배 더 오래 걸렸다.
  • 결과적으로 PGD가 최고의 1차 공격가 아니며, 철학적 경계 전파가 숨겨진 적대적 영역를 드러내어 적대적 탐색을 크게 향상시킬 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.