[논문 리뷰] AdvFlow: Inconspicuous Black-box Adversarial Attacks using Normalizing Flows
AdvFlow는 깨끗한 이미지 주변의 데이터 분포를 모델링하기 위해 사전 훈련된 정규화 흐름을 사용하는 새로운 블랙박스 적대적 공격을 제안한다. 이는 자연스러운 데이터 구조를 따라가는 편향을 가진 편향을 생성함으로써, 더 눈에 띄지 않고 탐지하기 어려운 적대적 예제를 만들어내며, 기존의 $σ$-Attack과 같은 기준 방법들에 비해 경쟁적인 성공률, 낮은 쿼리 수와 더불어 방어 모델에서 더 높은 전이성 확보를 가능하게 한다.
Deep learning classifiers are susceptible to well-crafted, imperceptible variations of their inputs, known as adversarial attacks. In this regard, the study of powerful attack models sheds light on the sources of vulnerability in these classifiers, hopefully leading to more robust ones. In this paper, we introduce AdvFlow: a novel black-box adversarial attack method on image classifiers that exploits the power of normalizing flows to model the density of adversarial examples around a given target image. We see that the proposed method generates adversaries that closely follow the clean data distribution, a property which makes their detection less likely. Also, our experimental results show competitive performance of the proposed approach with some of the existing attack methods on defended classifiers. The code is available at https://github.com/hmdolatabadi/AdvFlow.
연구 동기 및 목표
- 감지되지 않는, 데이터 구조를 고려한 편향을 생성하는 블랙박스 적대적 공격을 개발하기 위해.
- 깨끗한 이미지 주변의 진짜 데이터 분포를 모델링하기 위해 정규화 흐름을 활용하여, 적대적 예제가 자연스러운 데이터 다양체 내에 머물도록 보장하기 위해.
- 편향이 깨끗한 데이터의 분포와 구별되지 않도록 하여, 적대적 탐지에 대한 강건성을 향상시키기 위해.
- 기존의 블랙박스 공격들에 비해 방어 모델에서 더 높은 성공률과 더 낮은 쿼리 수를 달성하기 위해.
- 독립적이고 덧셈 형태의 노이즈 방법인 $σ$-Attack과 비교하여 플로우 기반 편향의 우수성을 입증하기 위해.
제안 방법
- 깨끗한 데이터에 대해 정규화 흐름을 사전 훈련하여 기저 데이터 분포를 학습하기 위해.
- 학습된 흐름을 사용하여 적대적 편향의 탐색 분포를 파arameter화하여, 자연스러운 데이터 구조를 따르는 편향이 되도록 하기 위해.
- 블랙박스 환경에서 검색 기반 기반의 자연 진화 전략(NES)과 검색 기반 기반의 기울기 추정을 사용하여 편향 분포를 최적화하기 위해.
- 대상 모델을 쿼리하여 편향을 반복적으로 개선하고, 기울기 추정을 사용하여 플로우 기반 분포를 업데이트하기 위해.
- 최적화된 플로우 기반 분포에서 샘플링하여 적대적 예제를 생성하며, 이는 깨끗한 데이터와 구조적으로 유사하다.
- AdvFlow 편향가 종속된 성분을 가진 정규분포로 근사할 수 있음을 보여주는 보조정리를 증명하기 위해.
실험 결과
연구 질문
- RQ1정규화 흐름이 자연스러운 데이터 분포를 따르는 블랙박스 적대적 예제를 효과적으로 생성하는 데 사용될 수 있는가?
- RQ2AdvFlow가 생성한 편향의 분포 유사성은 적대적 예제 탐지기의 감지 가능성에 어떤 영향을 미치는가?
- RQ3플로우 기반 분포를 통해 편향을 모델링하면, 덧셈 노이즈 기반 기준 방법에 비해 더 높은 공격 성공률과 더 낮은 쿼리 수를 달성할 수 있는가?
- RQ4AdvFlow는 방어 모델에서 어떻게 성능을 발휘하는가? 특히 전이성과 강건성 측면에서 어떻게 되는가?
- RQ5정규화 흐름이 사전 훈련 없이 무작위로 초기화된 상태에서도 AdvFlow가 효과적인 적대적 예제를 생성할 수 있는가?
주요 결과
- ImageNet의 Inception-v3에서 AdvFlow는 평균 375.00개의 쿼리(중앙값 200)를 사용하여 97.78%의 성공률을 기록했으며, 쿼리 효율성에서 $σ$-Attack(95.06%)와 Bandits(87.80%)를 뛰어넘었다.
- VGG16에서 AdvFlow는 평균 395.61개의 쿼리(중앙값 200)를 사용하여 99.57%의 성공률을 달성했으며, $σ$-Attack(99.57%)와 Bandits(95.46%)에 비해 효율성이 뛰어났다.
- 방어 모델인 Def. ResNet에서 AdvFlow는 평균 381.97개의 쿼리(중앙값 200)를 사용하여 57.20%의 성공률을 기록했으며, $σ$-Attack(33.99%)와 Bandits(50.77%)에 비해 뚜렷한 우월성을 보였다.
- 시각적 비교 결과, AdvFlow 편향는 이미지의 구조를 유지하며 $σ$-Attack의 픽셀 수준에서의 독립적 노이즈보다 더 눈에 띄지 않았다.
- 논문에서 증명된 보조정리는 AdvFlow 편향가 종속된 성분을 가짐을 확인하여, 더 자연스럽고 데이터에 일관된 편향을 가능하게 한다.
- 사전 훈련 없이 무작위로 초기화된 플로우를 사용하더라도, AdvFlow는 Inception-v3에서 97.78%의 성공률을 기록했으며, 성공률과 쿼리 효율성에서 Bandits와 $σ$-Attack을 모두 능가했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.