Skip to main content
QUICK REVIEW

[논문 리뷰] Boosting Black-Box Attack with Partially Transferred Conditional Adversarial Distribution

Feng Yan, Baoyuan Wu|arXiv (Cornell University)|2020. 06. 15.
Adversarial Robustness in Machine Learning참고 문헌 51인용 수 8
한 줄 요약

이 논문은 $π$-ATTACK를 제안하며, 흰 상자 대체 모델에서 조건부 적대적 분포(CAD)를 부분적으로 전이하여 쿼리 효율성과 공격 성공률을 향상시키는 새로운 블랙박스 적대적 공격 방법이다. 대상 모델 쿼리로부터 전이되지 않은 CAD 파라미터를 학습함으로써, 아키텍처 및 데이터셋 차이로 인한 대체 모델의 편향에 영향을 받지 않으며, 벤치마크 데이터셋과 실제 웹 API에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

This work studies black-box adversarial attacks against deep neural networks (DNNs), where the attacker can only access the query feedback returned by the attacked DNN model, while other information such as model parameters or the training datasets are unknown. One promising approach to improve attack performance is utilizing the adversarial transferability between some white-box surrogate models and the target model (i.e., the attacked model). However, due to the possible differences on model architectures and training datasets between surrogate and target models, dubbed "surrogate biases", the contribution of adversarial transferability to improving the attack performance may be weakened. To tackle this issue, we innovatively propose a black-box attack method by developing a novel mechanism of adversarial transferability, which is robust to the surrogate biases. The general idea is transferring partial parameters of the conditional adversarial distribution (CAD) of surrogate models, while learning the untransferred parameters based on queries to the target model, to keep the flexibility to adjust the CAD of the target model on any new benign sample. Extensive experiments on benchmark datasets and attacking against real-world API demonstrate the superior attack performance of the proposed method.

연구 동기 및 목표

  • 다른 모델 아키텍처와 훈련 데이터셋으로 인한 대체 편향으로 인해 블랙박스 공격에서 적대적 전이성이 떨어지는 문제를 해결하기 위해.
  • 폐쇄형 및 개방형 블랙박스 공격 시나리오에서 공격 성공률과 쿼리 효율성을 향상시키기 위해.
  • 새로운 정상 샘플에 유연하게 적응할 수 있도록 하면서도 유용한 대체 모델 지식을 활용하는 전이 메커니즘을 개발하기 위해.
  • 효율적인 훈련을 통해 조건부 생성 흐름(c-Glow)을 사용하여 복잡한 조건부 적대적 분포(CAD)를 정확히 모델링하기 위해.
  • 훈련 데이터가 알려지지 않았고 모델 차이가 크며 실제 환경에서의 성능을 검증하기 위해.

제안 방법

  • 부분 전이 메커니즘 제안: 대체 모델에서 CAD 파라미터의 일부만 전이하고, 나머지는 대상 모델 쿼리 피드백을 통해 학습함.
  • 조건부 생성 흐름(c-Glow)을 사용하여 CAD를 모델링함. 이는 간단한 분포(예: 정규분포)를 역행성 신경망을 통해 복잡한 CAD로 변환함.
  • 비용이 많이 드는 적대적 예제 대신 무작위로 샘플된 편향을 사용하여 c-Glow의 효율적인 훈련 알고리즘 개발으로 훈련 비용 절감.
  • 대상 모델의 쿼리 피드백을 활용해 전이되지 않은 CAD 파라미터를 미세조정함으로써, 각 새로운 정상 입력에 동적으로 적응 가능하게 함.
  • 폐쇄형(알려진 대상 모델 훈련 데이터) 및 개방형(알 수 없는 훈련 데이터) 시나리오 모두에 적용하며, 실제 웹 API 공격 포함.
  • CAD의 레이블 독립성 특성을 활용하여 대체 모델과 대상 모델 간 클래스 레이블 불일치에 민감도를 낮춤.

실험 결과

연구 질문

  • RQ1조건부 적대적 분포(CAD)의 부분 전이가 블랙박스 공격에서 대체 편향의 부정적 영향을 완화할 수 있는가?
  • RQ2대상 모델의 훈련 데이터가 알려지지 않은 개방형 시나리오에서 제안된 방법의 성능은 어떠한가?
  • RQ3조건부 생성 흐름(c-Glow)이 고정밀도와 효율성을 동시에 확보하면서 CAD를 효과적으로 모델링할 수 있는가?
  • RQ4적대적 예제 대신 무작위로 샘플된 편향을 사용함으로써 CAD 학습이 효과적이고 확장 가능하게 이루어지는가?
  • RQ5실제 시스템에서 최신 기술 수준의 블랙박스 공격과 비교했을 때, 공격 성공률과 쿼리 효율성 측면에서 제안된 방법의 성능은 어떠한가?

주요 결과

  • 폐쇄형 시나리오에서 $π$-ATTACK는 CIFAR-10 및 ImageNet에서 총 42개의 결과 중 35개가 최고 성능, 6개가 2위 성능을 기록함.
  • 개방형 시나리오에서 $π$-ATTACK는 총 27개의 결과 중 22개가 최고 성능, 3개가 2위 성능을 기록함. 대체 편향으로 인한 공격 성공률 감소율은 뿐만 아니라 0.53%에 그침.
  • 실제 웹 API인 Imagga Tagging API(개방형, 실세계 환경)에서 $π$-ATTACK는 85%의 공격 성공률과 중앙값 21.0개의 쿼리를 기록하며, 모든 기준 모델을 초월함.
  • API 공격에서 중앙값 쿼리 수를 21.0으로 줄였고, 이는 SimBA의 96.0과 TREMBA의 51.0보다 뛰어난 쿼리 효율성을 보임.
  • 대체 편향으로 인한 공격 성공률 감소율이 단 0.53%에 불과하여, 다른 쿼리-전이 방법보다 아키텍처 및 데이터셋 차이에 대해 훨씬 더 강건함을 입증함.
  • 무작위 편향 훈련을 사용한 c-Glow 기반 CAD 모델링은 정확하고 효율적인 CAD 근사화를 가능하게 하여, 본 방법의 효과성을 뒷받침함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.