[논문 리뷰] Switching Gradient Directions for Query-Efficient Black-Box Adversarial Attacks.
이 논문은 점수 기반 블랙박스 공격 환경에서 쿼리 효율성을 높이기 위해, 대체 모델 기울기와 무작위 탐색을 사용하여 동적으로 기울기 방향을 전환하는 SWITCH를 제안한다. 기울기 추정을 위해 쿼리를 사용하지 않고, 오직 방향 전환 여부를 결정하기 위한 쿼리만 사용함으로써, ℓ₂ 및 ℓ∞ 노름에서 최신 기술 수준(SOTA) 성능을 달성한다. CIFAR-10, CIFAR-100, 그리고 TinyImageNet에서 10개의 기존 SOTA 공격을 뛰어넘는 놀라운 쿼리 효율성으로 최고의 성능을 기록한다.
We propose a simple and highly query-efficient black-box adversarial attack named SWITCH, which has a state-of-the-art performance under $\ell_2$ and $\ell_\infty$ norms in the score-based setting. In the black box attack setting, designing query-efficient attacks remains an open problem. The high query efficiency of the proposed approach stems from the combination of transfer-based attacks and random-search-based ones. The surrogate model's gradient $\hat{\mathbf{g}}$ is exploited for the guidance, which is then switched if our algorithm detects that it does not point to the adversarial region by using a query, thereby keeping the objective loss function of the target model rising as much as possible. Two switch operations are available, i.e., SWITCH$_ ext{neg}$ and SWITCH$_ ext{rnd}$. SWITCH$_ ext{neg}$ takes $-\hat{\mathbf{g}}$ as the new direction, which is reasonable under an approximate local linearity assumption. SWITCH$_ ext{rnd}$ computes the gradient from another model, which is randomly selected from a large model set, to help bypass the potential obstacle in optimization. Experimental results show that these strategies boost the optimization process whereas following the original surrogate gradients does not work. In SWITCH, no query is used to estimate the gradient, and all the queries aim to determine whether to switch directions, resulting in unprecedented query efficiency. We demonstrate that our approach outperforms 10 state-of-the-art attacks on CIFAR-10, CIFAR-100 and TinyImageNet datasets. SWITCH can serve as a strong baseline for future black-box attacks. The PyTorch source code is released in this https URL .
연구 동기 및 목표
- 점수 기반 설정에서 쿼리 효율적인 블랙박스 공격을 설계하는 데 도전하는 것.
- 이행 기반 및 무작위 탐색 기반 전략을 융합하여 블랙박스 공격의 최적화 효율을 향상시키는 것.
- 기울기 추정을 위해 쿼리를 사용하지 않음으로써, 악성 예제 생성에 필요한 쿼리 수를 줄이는 것.
- 현재 기울기 방향이 손실을 감소시키지 못할 경우, 쿼리 피드백 기반으로 지능적으로 기울기 방향을 전환하는 방법을 개발하는 것.
- 다양한 벤치마크 데이터셋에서 쿼리 효율적인 블랙박스 공격의 새로운 SOTA 기준을 설정하는 것.
제안 방법
- SWITCH는 공격 대상 모델의 방향을 안내하기 위해 대체 모델을 사용해 初기 기울기 방향을 확보한다.
- 두 가지 전환 메커니즘을 활용한다: SWITCH_neg는 기울기를 −ĝ로 뒤집고, SWITCH_rnd는 큰 앙상블에서 무작위로 선택된 모델로부터 새로운 기울기를 샘플링한다.
- 현재 기울기 방향이 효과적이지 않음을 판단하기 위해 단일 쿼리를 사용하며, 손실이 감소하지 않으면 전환을 유도한다.
- 모든 쿼리는 기울기 방향 전환 여부를 결정하기 위한 것뿐이며, 기울기 추정에는 사용되지 않아 쿼리 효율성을 극대화한다.
- 근사적인 국소 선형성 가정을 바탕으로, 원래 방향이 생산적이지 않아지면 −ĝ를 사용하는 것이 타당하다고 정당화한다.
- 방향 전환 시 목적 손실이 가능한 한 크게 증가하도록 설계되어 있어, 항상 악성 예제 생성 방향으로 계속 진전됨을 보장한다.
실험 결과
연구 질문
- RQ1기울기 방향의 동적 전환은 블랙박스 공격에서 쿼리 효율성을 향상시킬 수 있는가?
- RQ2대체 기울기가 실패했을 경우, −ĝ로 전환하거나 다른 모델에서 무작위로 샘플링한 기울기로 전환하는 것이 최적화 장애물을 우회하는 데 도움이 되는가?
- RQ3기울기 추정을 위한 쿼리를 피하면서도 공격 성공률를 유지하거나 향상시킬 수 있는가?
- RQ4다양한 데이터셋에서 기존의 최신 기술 수준 공격과 비교해 SWITCH의 쿼리 효율성과 공격 성공률는 어떠한가?
- RQ5SWITCH는 향후 블랙박스 공격 연구를 위한 강력하고 일반화 가능한 기준이 될 수 있는가?
주요 결과
- SWITCH는 점수 기반 블랙박스 공격 설정에서 ℓ₂ 및 ℓ∞ 노름 모두 최신 기술 수준(SOTA) 성능을 달성한다.
- CIFAR-10, CIFAR-100, 그리고 TinyImageNet에서 10개의 기존 SOTA 공격을 뛰어넘는 놀라운 쿼리 효율성과 공격 성공률를 기록한다.
- 기울기 추정을 위해 쿼리를 사용하지 않고, 오직 방향 전환 여부를 결정하기 위한 쿼리만 사용함으로써, 기존에 없었던 수준의 쿼리 효율성을 달성한다.
- SWITCH_neg 및 SWITCH_rnd 전략 모두 최적화 성능을 향상시키며, 특히 SWITCH_rnd는 局부 최소값을 벗어나는 데 매우 효과적이다.
- 실험 결과, 원래의 대체 기울기 방향을 그대로 따를 경우 성능이 열악해지는 것을 확인하여, 동적 방향 전환의 必要성을 검증한다.
- SWITCH의 PyTorch 코드가 공개되어 재현성과 블랙박스 공격 연구 분야에서 새로운 SOTA 기준으로의 도입을 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.