Skip to main content
QUICK REVIEW

[논문 리뷰] Local Black-box Adversarial Attacks: A Query Efficient Approach

Tao Xiang, Hangcheng Liu|arXiv (Cornell University)|2021. 01. 04.
Adversarial Robustness in Machine Learning참고 문헌 38인용 수 12
한 줄 요약

이 논문은 모델 해석의 전이성과 적대적 예제를 활용하여 유일하게 분류적 이미지 영역을 대상으로 하는 쿼리 효율적인 블랙박스 적대적 공격 프레임워크를 제안한다. 기준 모델의 Grad-CAM을 통해 핵심 특징을 식별하고, 전이 가능한 적대적 노이즈로 사전 편향을 가한 후, 공격에 필요한 쿼리 수를 최대 50% 감소시키면서도, 제한된 쿼리 조건에서도 98% 이상의 높은 공격 성공률을 유지한다.

ABSTRACT

Adversarial attacks have threatened the application of deep neural networks in security-sensitive scenarios. Most existing black-box attacks fool the target model by interacting with it many times and producing global perturbations. However, global perturbations change the smooth and insignificant background, which not only makes the perturbation more easily be perceived but also increases the query overhead. In this paper, we propose a novel framework to perturb the discriminative areas of clean examples only within limited queries in black-box attacks. Our framework is constructed based on two types of transferability. The first one is the transferability of model interpretations. Based on this property, we identify the discriminative areas of a given clean example easily for local perturbations. The second is the transferability of adversarial examples. It helps us to produce a local pre-perturbation for improving query efficiency. After identifying the discriminative areas and pre-perturbing, we generate the final adversarial examples from the pre-perturbed example by querying the targeted model with two kinds of black-box attack techniques, i.e., gradient estimation and random search. We conduct extensive experiments to show that our framework can significantly improve the query efficiency during black-box perturbing with a high attack success rate. Experimental results show that our attacks outperform state-of-the-art black-box attacks under various system settings.

연구 동기 및 목표

  • 모든 픽셀을 훼손하는 전역 블랙박스 공격의 높은 쿼리 비용과 낮은 시각적 은폐성 문제를 해결하기 위해.
  • 화이트박스 접근 권한이 없거나 고비용 세그멘테이션 모델이 필요 없는 블랙박스 환경에서 국소 적대적 공격을 가능하게 하기 위해.
  • 모델 해석과 적대적 예제의 전이성을 활용하여 쿼리 효율성을 향상시키기 위해.
  • 목표로 하는 국소 편향을 통해 시각적으로 눈에 띄는 편향을 최소화하면서도 높은 공격 성공률을 달성하기 위해.
  • 실제 API 기반 위협 시나리오에 적용 가능한 실용적이고 효율적이며 은폐성이 높은 블랙박스 공격 프레임워크를 제공하기 위해.

제안 방법

  • 타겟 모델의 내부 파rameter에 접근하지 않고도 기준 모델의 Grad-CAM을 사용하여 분류적 이미지 영역을 식별한다.
  • 기준 모델에서 생성한 적대적 예제의 전이성을 활용하여, 타겟 모델의 결정 경계 근처에 가까운 초기 공격 예제를 생성한다.
  • 사전 편향된 예제에 대해 두 가지 쿼리 기반 공격 기법—기울기 추정과 무작위 탐색—을 적용하여 최종 적대적 샘플을 생성한다.
  • 분류적 영역 국소화와 적대적 사전편향을 조합하여 결정 경계를 넘기 위해 필요한 쿼리 수를 줄인다.
  • 여러 기준 모델이 존재할 경우, 그들의 이진 맵을 합쳐 강력한 분류적 영역을 정의한다.
  • 수정된 업데이트 규칙을 적용한다: $\mathbf{x}_{t+1} = \text{clip}(\mathbf{x}_t + \epsilon_1 \cdot (\text{sign}(\nabla_{\mathbf{x}_t}H) \otimes \text{sign}(UBM)))$, 여기서 $H$는 다수의 기준 모델에서의 로짓을 통합한 것이고, $UBM$은 그들의 이진 맵의 합집합이다.

실험 결과

연구 질문

  • RQ1분류적 이미지 영역에 국한된 국소적 편향이 블랙박스 공격의 쿼리 효율성 향상에 기여하는가?
  • RQ2Grad-CAM과 같은 모델 해석 기법이 기준 모델에서 타겟 블랙박스 환경으로 효과적으로 전이되어 분류적 영역을 식별할 수 있는가?
  • RQ3기준 모델에서 생성한 적대적 예제를 사용해 청소년 이미지를 사전 편향함으로써 타겟 모델을 속이기 위해 필요한 쿼리 수를 줄일 수 있는가?
  • RQ4제안된 방법은 최신 기술의 전역 블랙박스 공격과 비교해 쿼리 효율성과 공격 성공률 측면에서 어떻게 성과를 내는가?
  • RQ5여러 기준 모델을 사용하면 공격의 쿼리 효율성과 강건성은 더욱 향상되는가?

주요 결과

  • 제안된 방법은 ResNet-50 기준 모델을 사용해 ImageNet에서 단 204개의 쿼리로 98%의 공격 성공률를 달성했으며, GRS보다 성공률와 쿼리 효율성 측면에서 뛰어나다.
  • ResNet-1000 기준 모델을 사용할 경우, 단 71개의 쿼리로도 100%의 성공률를 기록하여 더 나은 기준 모델일수록 강력한 확장성을 보였다.
  • 기본 전역 공격 대비 최대 50%의 쿼리 수 감소를 이끌었으며, 높은 공격 성공률를 유지했다.
  • 약한 기준 모델(ResNet-50)을 사용할 경우에도 426개의 쿼리로 79%의 성공률를 달성하여 기준 모델 품질이 제한된 상황에서도 강건함을 입증했다.
  • 여러 기준 모델을 사용함으로써 타겟 모델의 결정 경계 근처에 초기 적대적 예제를 생성할 확률이 높아져, 더욱 효율적인 공격이 가능했다.
  • 공격은 시각적으로 열등한 편향을 생성했으며, 이는 이전의 국소 공격에서 픽셀을 균일하게 (255,255,255)로 훼손함으로써 발생하는 눈에 띄는 노이즈 패턴을 피했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.