Skip to main content
QUICK REVIEW

[논문 리뷰] The Efficacy of SHIELD under Different Threat Models

Cory Cornelius, Das, Nilaksh|arXiv (Cornell University)|2019. 02. 01.
Adversarial Robustness in Machine Learning참고 문헌 19인용 수 5
한 줄 요약

이 논문은 공격자가 앙상블 아키텍처, 방어 전처리, 모델 가중치를 모두 알고 있는 적응형 위협 모델에서 암시적 압축 기반 방어인 Shield의 성능을 평가한다. 모델을 사전 학습된 가중치에서 재학습하는 대신 처음부터 학습시키는 것이 화이트박스 환경에서 타겟된 PGD 공격의 성공률을 64.3%에서 48.9%로 낮추며, 이는 가중치 상관관계가 강건성에 상당한 영향을 미친다는 것을 시사한다.

ABSTRACT

In this appraisal paper, we evaluate the efficacy of SHIELD, a compression-based defense framework for countering adversarial attacks on image classification models, which was published at KDD 2018. Here, we consider alternative threat models not studied in the original work, where we assume that an adaptive adversary is aware of the ensemble defense approach, the defensive pre-processing, and the architecture and weights of the models used in the ensemble. We define scenarios with varying levels of threat and empirically analyze the proposed defense by varying the degree of information available to the attacker, spanning from a full white-box attack to the gray-box threat model described in the original work. To evaluate the robustness of the defense against an adaptive attacker, we consider the targeted-attack success rate of the Projected Gradient Descent (PGD) attack, which is a strong gradient-based adversarial attack proposed in adversarial machine learning research. We also experiment with training the SHIELD ensemble from scratch, which is different from re-training using a pre-trained model as done in the original work. We find that the targeted PGD attack has a success rate of 64.3% against the original SHIELD ensemble in the full white box scenario, but this drops to 48.9% if the models used in the ensemble are trained from scratch instead of being retrained. Our experiments further reveal that an ensemble whose models are re-trained indeed have higher correlation in the cosine similarity space, and models that are trained from scratch are less vulnerable to targeted attacks in the white-box and gray-box scenarios.

연구 동기 및 목표

  • 공격자가 방어 시스템에 대해 점점 더 많은 지식을 갖춘 적응형 공격자에 대한 Shield의 강건성을 평가하기 위해.
  • 원래 Shield 논문에서 고려되지 않은 다양한 위협 모델 하에서 강력한 투사된 기울기 하강(PGD) 공격의 효과성을 평가하기 위해.
  • 특히 사전 학습된 모델에서 재학습하는 것과 처음부터 학습시키는 것의 차이가 모델 가중치 상관관계와 방어 강건성에 어떤 영향을 미치는지 조사하기 위해.
  • 화이트박스 및 GRAY-BOX 환경에서 가중치 상관관계가 낮은 앙상블 모델이 타겟된 적대적 공격에 더 강건한지 판단하기 위해.

제안 방법

  • 공격자가 방어 구성 요소를 모두 안다는 화이트박스에서부터 공격자가 모델 아키텍처만 안다는 GRAY-BOX에 이르기까지 다양한 위협 모델 하에서 Shield를 실증적으로 평가한다.
  • 타겟된 PGD 공격을 사용하여 위협 모델 간의 성공률을 측정하며, 특히 가장 낮은 확률을 예측하는 클래스를 타겟으로 삼는 공격에 집중한다.
  • JPEG 압축 이미지에서 사전 학습된 ResNet-50 v2 모델을 재학습하여, 동일한 데이터에서 처음부터 학습시킨 모델을 포함한 두 가지 버전의 Shield 앙상블을 훈련시킨다.
  • 모델 특징 맵 간의 코사인 유사도를 사용해 가중치 상관관계를 측정하여, 훈련 절차가 앙상블 다양성에 어떤 영향을 미치는지 분석한다.
  • 적대적 예제의 이식성(transferability)을 테스트하기 위해 새로 학습된 모델에 대해 공격을 생성하고, 원래 Shield 앙상블에 대해 테스트한다.
  • 다양한 위협 모델과 훈련 절차 간의 모델 정확도 저하와 공격 성공률을 비교한다.

실험 결과

연구 질문

  • RQ1공격자가 앙상블 아키텍처, 전처리, 모델 가중치를 모두 안다는 완전한 화이트박스 위협 모델에서 타겟된 PGD 공격은 Shield에 대해 어떤 성능을 보이는가?
  • RQ2사전 학습된 가중치에서 재학습하는 대신 처음부터 학습시키는 것이 화이트박스 및 GRAY-BOX 환경에서 타겟된 공격에 대한 강건성을 향상시키는가?
  • RQ3앙상블 모델 간의 가중치 상관관계가 타겟된 적대적 공격의 성공률에 얼마나 큰 영향을 미치는가?
  • RQ4새로운 모델에 대해 생성된 적대적 예제가 GRAY-BOX 환경에서 원래 Shield 앙상블을 성공적으로 속일 수 있는가?
  • RQ5특히 PGD와 같은 강력한 기울기 기반 공격을 사용할 경우, 비적응형과 적응형 위협 모델 간에 Shield의 강건성은 어떻게 비교되는가?

주요 결과

  • 완전한 화이트박스 위협 모델에서 타겟된 PGD 공격은 사전 학습된 모델을 사용한 원래 Shield 앙상블에 대해 64.3%의 성공률을 기록한다.
  • 원래 Shield 앙상블의 모델을 재학습하는 대신 처음부터 학습시키면 타겟된 PGD 공격의 성공률은 48.9%로 떨어지며, 이는 15.4%포인트 감소한 것이다.
  • 원래 Shield 앙상블에 사용된 재학습된 모델들은 코사인 유사도 공간에서 높은 가중치 상관관계를 보이며, 이는 앙상블이 타겟된 공격에 더 취약하게 만들었다.
  • 처음부터 학습시킨 모델들은 낮은 가중치 상관관계를 보이며, 화이트박스 및 GRAY-BOX 위협 모델 모두에서 타겟된 공격에 훨씬 더 강건하다.
  • 공격자가 모델 아키텍처만 안다는 GRAY-BOX 위협 모델에서 타겟된 PGD 공격은 완전히 실패하여 0%의 성공률을 기록한다. 이는 모델 정확도가 저하되더라도 마찬가지다.
  • 그러나 그로 인해 모델 정확도가 저하된 상황에서도 빠른 기울기 방법(Fast Gradient Method, FGM) 역시 예측 제어를 실패하며, 0%의 공격 성공률을 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.