Skip to main content
QUICK REVIEW

[논문 리뷰] CorrAttack: Black-box Adversarial Attack with Structured Search

Zhichao Huang, Yao‐Wei Huang|arXiv (Cornell University)|2020. 10. 03.
Adversarial Robustness in Machine Learning참고 문헌 30인용 수 6
한 줄 요약

CorrAttack는 시간에 따라 변화하는 문맥 bandit를 통한 구조적 탐색을 사용하여 점수 기반 블랙박스 적대적 공격을 제안하며, 이미지 블록을 특징으로 모델링하여 베이지안 최적화를 안내함으로써 효율적이고 높은 성공률을 달성한다. 이는 ImageNet과 Google Cloud Vision API에서 최신 기술을 초월하는 쿼리 효율성과 성공률을 달성한다.

ABSTRACT

We present a new method for score-based adversarial attack, where the attacker queries the loss-oracle of the target model. Our method employs a parameterized search space with a structure that captures the relationship of the gradient of the loss function. We show that searching over the structured space can be approximated by a time-varying contextual bandits problem, where the attacker takes feature of the associated arm to make modifications of the input, and receives an immediate reward as the reduction of the loss function. The time-varying contextual bandits problem can then be solved by a Bayesian optimization procedure, which can take advantage of the features of the structured action space. The experiments on ImageNet and the Google Cloud Vision API demonstrate that the proposed method achieves the state of the art success rates and query efficiencies for both undefended and defended models.

연구 동기 및 목표

  • 모델 점수 외에 전체 모델에 대한 액세스가 없는 상황에서 효율적인 블랙박스 적대적 공격 문제를 해결한다.
  • 모델 유사성에 의존하는 전이 기반 공격의 한계를 극복하며, 상이한 네트워크 간 전이성 저하 문제를 해결한다.
  • 이미지 블록의 국소적 상관관계와 느슨한 변화 성질을 활용하여 점수 기반 공격의 쿼리 효율성과 성공률을 향상시킨다.
  • 고차원 기울기 추정을 피하고 저차원 블록 특징에 집중함으로써 확장 가능한 방법을 개발하여 기존 베이지안 최적화 접근보다 빠른 최적화를 가능하게 한다.

제안 방법

  • 각 이미지 블록을 특징을 가진 암호로 간주하는 시간에 따라 변화하는 문맥 bandit 문제로 점수 기반 적대적 공격을 공식화한다.
  • 블록 특징에 기반한 가우시안 프로세스 회귀를 사용하여 보상(손실 감소)을 모델링함으로써 구조화된 행동 공간에서 효율적인 베이지안 최적화를 가능하게 한다.
  • 반복적 공격 단계 동안 시간에 따라 변화하는 보상 함수에 적응하기 위해 가우시안 프로세스에 망각 전략을 통합한다.
  • 공간적 위치와 국소 기울기 패턴과 같은 블록 수준의 특징을 사용하여 향후 보상을 추정하고 행동 선택을 안내한다.
  • 행동 공간을 이미지 블록으로 제한하여 국소적 상관관계와 느슨한 변화 성질을 활용함으로써 학습 효율성을 향상시킨다.
  • 구조적 특징을 활용한 베이지안 최적화를 적용하여 예상 보상 감소가 가장 큰 블록을 우선순위로 정함으로써 쿼리 수를 최소화한다.

실험 결과

연구 질문

  • RQ1무작위 또는 좌표 기반 탐색과 비교할 때 이미지 블록에 대한 구조적 탐색이 블랙박스 적대적 공격의 쿼리 효율성을 향상시키는가?
  • RQ2이미지 블록의 특징을 사용하여 보상 함수를 모델링하면 베이지안 최적화의 성능이 어떻게 향상되는가?
  • RQ3bandit 문제의 시간에 따라 변화하는 성질이 표준 베이지안 최적화의 효과성에 어떤 영향을 미치며, 이를 어떻게 완화할 수 있는가?
  • RQ4CorrAttack는 BayesOpt, Bayes-Attack, ZOO와 같은 최신 기술과 비교하여 표준 모델 및 보호된 모델에서 성능과 효율성 면에서 어떻게 성과를 내는가?
  • RQ5Google Cloud Vision과 같이 쿼리 비용이 높고 모델 행동이 알려져 있지 않은 실제 웹 기반 블랙박스 API에서도 제안된 방법이 높은 성공률을 달성할 수 있는가?

주요 결과

  • CorrAttack ${}_{\text{Flip}}$는 ImageNet의 ResNet50에 대해 1,036회 평균 쿼리로 비타겟팅 공격에서 79.15%의 성공률을 기록하며 모든 기준선을 능가한다.
  • Google Cloud Vision API에서 CorrAttack ${}_{\text{Flip}}$는 155회 평균 쿼리로 80.00%의 성공률을 달성하여 NAttack(70.00%)와 BayesOpt(30.00%)를 크게 앞서간다.
  • 보호된 모델(ResNeXt DenoiseAll)에 대해 CorrAttack ${}_{\text{Flip}}$는 10개 이미지에서 평균 206회 쿼리로 60.00%의 성공률을 기록하며 BayesOpt와 Bayes-Attack을 능가한다.
  • 제거 실험을 통해 블록 특징 차원을 감소시키기 위해 PCA를 사용할 경우 공격 효율성이 향상됨을 확인하여 특징 표현의 중요성을 입증한다.
  • CorrAttack는 다양한 변형 예산($\varepsilon = 0.04$, $0.05$, $0.06$)에서도 뛰어난 성능을 유지하며 공격 강도의 변화에 대한 강건성을 보여준다.
  • 기존의 베이지안 최적화 접근 방식보다 훨씬 빠른 속도를 기록하며, 1,000장의 이미지를 공격하는 데 수만 시간이 소요되는 BayesOpt와 Bayes-Attack에 비해 저차원 특징 기반 최적화 덕분에 효율성이 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.