Skip to main content
QUICK REVIEW

[논문 리뷰] Distributionally Adversarial Attack

Tianhang Zheng, Changyou Chen|arXiv (Cornell University)|2018. 08. 16.
Adversarial Robustness in Machine Learning참고 문헌 24인용 수 11
한 줄 요약

이 논문은 데이터 분포의 공간을 최적화하는 첫 번째 순서의 $L_\infty$ 적대적 공격인 분포 기반 적대적 공격(DAA)을 제안한다. 이는 개별 샘플이 아닌 데이터 분포의 공간을 최적화하며, 워샤르슈타인 기울기 유동을 사용하여 전역적으로 최적이고 상호의존적인 편향을 생성한다. DAA는 최신 적대적 훈련 모델에서 PGD를 능가하며, $\epsilon=0.3$ 일 때 MadryLab의 비밀 MNIST 모델에서 공격 성공률가 88.79%에 달했고, CIFAR-10에서는 $\epsilon=8.0$ 일 때 44.71%를 기록하여 MIT MadryLab의 화이트박스 랭킹에서 1위를 차지했다.

ABSTRACT

Recent work on adversarial attack has shown that Projected Gradient Descent (PGD) Adversary is a universal first-order adversary, and the classifier adversarially trained by PGD is robust against a wide range of first-order attacks. It is worth noting that the original objective of an attack/defense model relies on a data distribution $p(\mathbf{x})$, typically in the form of risk maximization/minimization, e.g., $\max/\min\mathbb{E}_{p(\mathbf(x))}\mathcal{L}(\mathbf{x})$ with $p(\mathbf{x})$ some unknown data distribution and $\mathcal{L}(\cdot)$ a loss function. However, since PGD generates attack samples independently for each data sample based on $\mathcal{L}(\cdot)$, the procedure does not necessarily lead to good generalization in terms of risk optimization. In this paper, we achieve the goal by proposing distributionally adversarial attack (DAA), a framework to solve an optimal {\em adversarial-data distribution}, a perturbed distribution that satisfies the $L_\infty$ constraint but deviates from the original data distribution to increase the generalization risk maximally. Algorithmically, DAA performs optimization on the space of potential data distributions, which introduces direct dependency between all data points when generating adversarial samples. DAA is evaluated by attacking state-of-the-art defense models, including the adversarially-trained models provided by {\em MIT MadryLab}. Notably, DAA ranks {\em the first place} on MadryLab's white-box leaderboards, reducing the accuracy of their secret MNIST model to $88.79\%$ (with $l_\infty$ perturbations of $ε= 0.3$) and the accuracy of their secret CIFAR model to $44.71\%$ (with $l_\infty$ perturbations of $ε= 8.0$). Code for the experiments is released on \url{https://github.com/tianzheng4/Distributionally-Adversarial-Attack}.

연구 동기 및 목표

  • PGD와 같은 첫 번째 순서의 적대적 공격가 각 샘플마다 독립적으로 편향을 생성하고 전역적 리스크 최적화를 수행하지 못하는 한계를 해결하기 위해.
  • 확률 측도의 최적화를 통해 일반화 리스크를 최대화하는 원리적인 분포 수준의 적대적 공격 프레임워크를 개발하기 위해.
  • 더 효과적이고 전역적으로 일관된 편향을 생성함으로써 적대적 훈련 모델의 강건성 평가를 향상시키기 위해.
  • 기존의 PGD와 비교해도 첫 번째 순서 방법에 강건한 모델에 대해서도 분포 최적화 관점이 더 강력한 공격을 유도할 수 있음을 입증하기 위해.

제안 방법

  • DAA는 $L_\infty$ 제약 조건 하에서 일반화 리스크를 최대화하는 적대적 데이터 분포를 찾는 방식으로, 확률 측도의 공간에서 최적화 문제로 공격를 수립한다.
  • 에너지 기능이 데이터 다양체를 반영하고 모델의 손실 목표와 일치하도록 설계된 워샤르슈타인 기울기 유동(WGFs)을 사용하여 데이터 분포를 진화시킨다.
  • 실제 데이터 다양체를 추정하기 위해 테스트 데이터를 사용한 입자 근사 기법을 적용하여 분포 수준의 최적화를 실용적인 알고리즘으로 변환한다.
  • 결과적으로 생성된 알고리즘은 배치 내에서 상호의존적으로 연결된 적대적 샘플을 생성하며, PGD가 각 샘플마다 독립적인 편향을 생성하는 것과 다르다.
  • 두 가지 변종을 구현하였다: 손실 기반 에너지 기능을 사용하는 DAA-BLOB과 데이터 기울기 유동 기반 에너지 기능을 사용하는 DAA-DGF.
  • 표준 벤치마크를 사용하여 MNIST, FMNIST, CIFAR-10, ImageNet의 강건한 모델과 비교하여 PGD 및 모멘텀 PGD와의 성능을 평가하였다.

실험 결과

연구 질문

  • RQ1데이터 분포의 공간을 최적화하는 적대적 공격가 PGD와 같은 표준 제1순서 공격보다 강건성 평가에서 뛰어난 성능을 보일 수 있는가?
  • RQ2분포 수준의 최적화 접근법이 개별 샘플의 PGD보다 더 효과적이고 전역적으로 일관된 편향을 생성하여 더 잘 일반화되는가?
  • RQ3워샤르슈타인 기울기 유동 프레임워크가 $L_\infty$ 제약 조건 하에서 더 강력한 적대적 공격을 생성하기 위해 효과적으로 적용될 수 있는가?
  • RQ4DAA는 최신 기술 수준의 적대적 훈련 모델, 특히 제1순서 공격에 강건한 것으로 간주되는 모델에 대해 어떻게 성능을 내는가?
  • RQ5제안된 분포 기반 공격 프레임워크가 PGD 기반 적대적 훈련으로 훈련된 모델에 대해 기존 방법보다 더 효과적인가?

주요 결과

  • DAA는 MIT MadryLab의 화이트박스 랭킹에서 가장 높은 공격 성공률을 기록했으며, $\epsilon=0.3$ 인 $L_\infty$ 편향을 사용해 비밀 MNIST 모델의 정확도를 88.79%로 낮췄다.
  • 비밀 CIFAR-10 모델에서 DAA는 $\epsilon=8.0$ 인 $L_\infty$ 편향을 사용해 정확도를 44.71%로 낮췄고, 랭킹에 등재된 모든 공격보다 뛰어난 성능을 보였다.
  • 단일 실행에서 DAA는 MadryLab의 MNIST 모델 정확도를 90.5%로 낮췄다 (PGD는 92.5%였으며), 공격 강도가 뛰어나다는 것을 입증했다.
  • FMNIST에서는 DAA가 적대적 훈련 모델의 정확도를 67.6%로 낮췄다 (PGD는 71.5%), 통계적으로 유의미한 p값(0.0 및 3e-27)을 기록했다.
  • ImageNet에서는 DAA가 앙상블된 적대적 훈련된 Inception ResNet-v2 모델의 정확도를 오직 $2/255$의 $L_\infty$ 편향으로 16.43%로 낮췄으며, 이는 Rand+FGSM의 70%보다 훨씬 낮은 성능이었다.
  • 50회의 무작위 재시작을 수행한 DAA는 공개 MNIST에서 88.7%, 비밀 MNIST에서 88.79%의 성능을 기록했으며, PGD 및 모멘텀 PGD를 꾸준히 능가했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.