Skip to main content
QUICK REVIEW

[논문 리뷰] Thundernna: a white box adversarial attack

Linfeng Ye, Hamidi, Shayan Mohajer|arXiv (Cornell University)|2021. 11. 24.
Adversarial Robustness in Machine Learning참고 문헌 3인용 수 4
한 줄 요약

Thundernna는 일차적이고 화이트박스 기반의 새로운 적대적 공격 기법을 제안하며, FGSM보다 높은 성공률을 달성하면서도 단단계 처리 효율성을 유지하여, 속도 면에서 일차 및 이차 방법을 모두 능가한다. 이는 손실 함수의 볼록화된 적분과 기울기 기반 노이즈 최적화를 활용하여 최소한의 계산 오버헤드로 효과적인 적대적 예제를 생성한다.

ABSTRACT

The existing work shows that the neural network trained by naive gradient-based optimization method is prone to adversarial attacks, adds small malicious on the ordinary input is enough to make the neural network wrong. At the same time, the attack against a neural network is the key to improving its robustness. The training against adversarial examples can make neural networks resist some kinds of adversarial attacks. At the same time, the adversarial attack against a neural network can also reveal some characteristics of the neural network, a complex high-dimensional non-linear function, as discussed in previous work. In This project, we develop a first-order method to attack the neural network. Compare with other first-order attacks, our method has a much higher success rate. Furthermore, it is much faster than second-order attacks and multi-steps first-order attacks.

연구 동기 및 목표

  • 기존 일차 방법보다 뛰어난 성능을 보이는 빠르고 정확도가 높은 화이트박스 기반 적대적 공격을 개발하는 것.
  • 적대적 예제 생성에서 공격 성공률과 계산 효율성 간의 상충 관계를 해결하는 것.
  • 기울기 기반 변형 생성의 안정성과 향상을 향상시키기 위해 볼록화된 음의 로그우도 손실 함수의 사용을 탐색하는 것.
  • 반복적 개선 없이도 효율적인 적대적 공격 생성을 가능하게 하여 단단계 처리 속도를 유지하는 것.
  • 다양한 변형 예산 하에서 적대적 변형의 강건성과 일반화 능력을 조사하는 것.

제안 방법

  • NLL 손실과 소프트맥스를 사용한 적대적 공격를 최적화 문제로 공식화하며, 이는 정의역 내에서 볼록 적분을 가지는 것으로 밝혀졌다.
  • 입력 이미지에 대한 NLL 손실의 기울기의 역수로 적대적 노이즈의 닫힌 형태 표현식을 유도한다.
  • 입력 픽셀이 상호 독립적이라고 가정하고, 기울기 분모를 모두 1로 이루어진 행렬로 근사함으로써 노이즈 계산을 1 / (∂NLL_loss / ∂image)로 단순화한다.
  • 전방 및 역방향 전파를 가속하기 위해 TVM 프레임워크를 사용하여 공격를 구현한다.
  • 반복적 개선을 피함으로써 단단계 방법으로서 고속을 유지하면서도 높은 성공률을 달성한다.
  • 데이터에 종속되지 않은 설계를 통해 다양한 입력과 작업 간의 이식성(transferability)을 보장한다.

실험 결과

연구 질문

  • RQ1단단계 일차 공격가 FGSM보다 높은 성공률을 달성하면서도 뛰어난 속도를 유지할 수 있는가?
  • RQ2볼록화된 손실 함수가 더 안정적이고 효과적인 기울기 기반 적대적 노이즈 생성을 가능하게 하는가?
  • RQ3Thundernna의 성공률는 증가하는 변형 예산에 따라 어떻게 변화하는가? 왜 고도의 예산에서 감소하는가?
  • RQ4반복적이지 않은 단단계 방법이 PGD나 이차 공격과 같은 반복적 방법보다 속도와 성공률 면에서 뛰어나게 성능을 냈는가?
  • RQ5이 볼록 손실 기반 기울기 방법을 통해 생성된 적대적 변형의 내재적 특성은 무엇인가?

주요 결과

  • Thundernna는 모든 테스트된 변형 예산(0.1에서 0.5)에서 FGSM보다 높은 공격 성공률를 기록하여 우수한 효과를 입증했다.
  • 50장의 이미지당 0.19초 내로 적대적 예제를 생성하여, PGD(0.909s/50)와 이차 공격(0.955s/50)보다 빠른 속도를 확보했다.
  • 단단계 방법임에도 불구하고, FGSM의 성공률를 초월하고 일부 다단계 방법과 비교해도 효율성과 정확도 면에서 뒤지지 않았다.
  • 공격 성공률는 증가하는 변형 예산에 따라 감소하는 경향을 보였는데, 이는 놀라운 결과이며 향후 추가 연구가 필요하다.
  • ResNet-18 기반 ImageNet-2012에서의 실험을 통해 표준 벤치마크에서의 강건성과 이식성을 확인했다.
  • 이론적 가정인 기울기 분모를 모두 1로 이루어진 행렬로 근사할 수 있다는 것이 실험적으로도 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.