Skip to main content
QUICK REVIEW

[논문 리뷰] Attacking Adversarial Attacks as A Defense

Boxi Wú, Heng Pan|arXiv (Cornell University)|2021. 06. 09.
Adversarial Robustness in Machine Learning참고 문헌 61인용 수 13
한 줄 요약

이 논문은 적대적 공격이 소규모 편향에 취약함을 이용하여, 동시에 모든 클래스를 공격하는 타겟된 방어 노이즈를 설계함으로써 새로운 방어 기법인 허지 디펜스(Hedge Defense)를 제안한다. 적대적 트레이닝된 모델에서 진짜 클래스의 국소 리프시츠 조건이 더 작다는 점을 활용하여, 잘못 분류된 적대적 예제를 다시 올바른 예측으로 되돌린다. 이로 인해 강력한 공격에 대비하여 CIFAR-10에서 최대 12.5% 향상되고, ImageNet에서는 5.36% 향상된다.

ABSTRACT

It is well known that adversarial attacks can fool deep neural networks with imperceptible perturbations. Although adversarial training significantly improves model robustness, failure cases of defense still broadly exist. In this work, we find that the adversarial attacks can also be vulnerable to small perturbations. Namely, on adversarially-trained models, perturbing adversarial examples with a small random noise may invalidate their misled predictions. After carefully examining state-of-the-art attacks of various kinds, we find that all these attacks have this deficiency to different extents. Enlightened by this finding, we propose to counter attacks by crafting more effective defensive perturbations. Our defensive perturbations leverage the advantage that adversarial training endows the ground-truth class with smaller local Lipschitzness. By simultaneously attacking all the classes, the misled predictions with larger Lipschitzness can be flipped into correct ones. We verify our defensive perturbation with both empirical experiments and theoretical analyses on a linear model. On CIFAR10, it boosts the state-of-the-art model from 66.16% to 72.66% against the four attacks of AutoAttack, including 71.76% to 83.30% against the Square attack. On ImageNet, the top-1 robust accuracy of FastAT is improved from 33.18% to 38.54% under the 100-step PGD attack.

연구 동기 및 목표

  • 적대적 트레이닝된 모델에서 자연적 정확도와 강건 정확도 사이의 지속적인 격차를 해결하기 위해.
  • 적대적 공격이 적대적 트레이닝된 모델에 적용되었을 때 소규모 입력 편향에 취약한가를 조사하기 위해.
  • 적대적 트레이닝된 모델의 구조적 특성을 이용하여 랜덤 노이즈보다 우수한 방어 기법을 개발하기 위해.
  • 기본 모델을 수정하지 않고 AutoAttack 및 Square Attack과 같은 강력한 공격에 대비하여 강건성을 향상시키기 위해.

제안 방법

  • 허지 디펜스는 적대적 트레이닝된 모델에서 진짜 클래스의 국소 리프시츠 조건이 더 작다는 사실을 이용하여, 동시에 모든 클래스를 타겟으로 하는 방어적 편향을 생성한다.
  • 손실 표면의 구조를 분석하여 잘못된 예측은 더 급격한 손실 표면을 가지며, 따라서 편향에 더 민감하다는 점을 확인한다.
  • 모델의 예측이 잘못된 클래스에서 벗어나 진짜 클래스로 돌아오도록, 모든 클래스에 동시에 기반한 기울기 기반 공격을 수행한다.
  • 각 예제에 맞게 맞춤형으로 방어적 편향을 생성하여, 무분별한 랜덤 노이즈보다 훨씬 높은 효과를 얻는다.
  • CIFAR-10과 ImageNet에서 실증적으로 검증하였으며, 선형 모델을 대상으로 이론적 분석을 통해 안정성과 강건성을 입증하였다.

실험 결과

연구 질문

  • RQ1적대적 트레이닝된 모델에 적용되었을 때, 적대적 공격이 소규모 입력 편향에 취약한가?
  • RQ2적대적 트레이닝된 모델에서 진짜 클래스의 더 작은 국소 리프시츠 조건을 이용해 방어적 편향을 설계할 수 있는가?
  • RQ3클래스에 종속되지 않는 다중 클래스 공격 전략은 랜덤 노이즈나 단일 클래스 공격에 비해 강건성을 향상시키는가?
  • RQ4허지 디펜스는 AutoAttack 및 Square Attack과 같은 강력한 앙상블 공격에 대해 상당한 강건 정확도 향상을 이룰 수 있는가?

주요 결과

  • CIFAR-10에서 허지 디펜스는 최신 기준 모델의 강건 정확도를 AutoAttack(4개의 강력한 공격을 조합한 앙상블)에 대비해 66.16%에서 72.66%로 향상시켰다.
  • Square 공격(최고의 블랙박스 공격 중 하나)에 대비해 강건 정확도는 71.76%에서 83.30%로 향상되었다.
  • ImageNet에서는 허지 디펜스가 FastAT의 top-1 강건 정확도를 100단계 PGD 공격 하에서 33.18%에서 38.54%로 끌어올렸다.
  • 실증 결과에 따르면, 적대적 공격은 균일하게 강건하지 않다. DeepFool 및 Square 공격은 소규모 랜덤 편향에서 상당히 성능이 저하되는 반면, PGD 및 C&W는 더 강건한 편이다.
  • 선형 모델에 대한 이론적 분석을 통해 진짜 클래스가 더 평탄한 손실 표면을 가짐을 확인하여, 이 방법의 설계가 타당함을 입증하였다.
  • EOT 및 BPDA와 같은 철저한 공격에도 허지 디펜스는 견고함을 유지하여, 기울기 가려움 현상에 취약하지 않음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.