Skip to main content
QUICK REVIEW

[논문 리뷰] Breaking Transferability of Adversarial Samples with Randomness

Yan Zhou, Murat Kantarcıoğlu|arXiv (Cornell University)|2018. 05. 11.
Adversarial Robustness in Machine Learning참고 문헌 38인용 수 15
한 줄 요약

이 논문은 딥 뉴럴 네트워크(DNNs)에서 적대적 공격의 전이성(transferability)을 깨뜨리기 위해 두 가지 랜덤라이제이션 기반 방식을 제안한다. 추론 시점에 100개의 사전 훈련된 모델 풀에서 랜덤으로 DNN를 선택하거나, 모델 가중치에 작은 가우시안 노이즈를 추가함으로써 강건성을 크게 향상시킨다—청정 데이터에서 최대 74.2% 향상된 강건성 확보—재훈련이 필요 없이, 다양한 공격 예산 하에서 앙상블 적대적 훈련을 능가한다.

ABSTRACT

We investigate the role of transferability of adversarial attacks in the observed vulnerabilities of Deep Neural Networks (DNNs). We demonstrate that introducing randomness to the DNN models is sufficient to defeat adversarial attacks, given that the adversary does not have an unlimited attack budget. Instead of making one specific DNN model robust to perfect knowledge attacks (a.k.a, white box attacks), creating randomness within an army of DNNs completely eliminates the possibility of perfect knowledge acquisition, resulting in a significantly more robust DNN ensemble against the strongest form of attacks. We also show that when the adversary has an unlimited budget of data perturbation, all defensive techniques would eventually break down as the budget increases. Therefore, it is important to understand the game saddle point where the adversary would not further pursue this endeavor. Furthermore, we explore the relationship between attack severity and decision boundary robustness in the version space. We empirically demonstrate that by simply adding a small Gaussian random noise to the learned weights, a DNN model can increase its resilience to adversarial attacks by as much as 74.2%. More importantly, we show that by randomly activating/revealing a model from a pool of pre-trained DNNs at each query request, we can put a tremendous strain on the adversary's attack strategies. We compare our randomization techniques to the Ensemble Adversarial Training technique and show that our randomization techniques are superior under different attack budget constraints.

연구 동기 및 목표

  • 적대적 전이성이 DNNs에서 본질적이고 피할 수 없다는 가정을 도전하기 위해.
  • DNNs의 버전 공간에서 결정 경계의 강건성과 공격 심각도 간의 상호작용을 조사하기 위해.
  • 재훈련이 필요 없이 적대적 전이성을 방해하는 실용적이고 계산 효율적인 방어 기법을 개발하기 위해.
  • 특히 블랙박스 환경에서 다양한 공격 예산 하에서 랜덤라이제이션 기법의 효과를 평가하기 위해.
  • 제안된 방법을 앙상블 적대적 훈련과 비교하여 제약된 변형 예산 하에서 더 높은 강건성을 보여주기 위해.

제안 방법

  • 각 추론 쿼리 시 사전 훈련된 100개 모델의 풀에서 랜덤으로 DNN를 선택하여 공격자가 사용한 모델을 은폐한다.
  • 단일 DNN의 학습된 가중치에 작은 가우시안 랜덤 노이즈를 도입하여 적대적 변형에 대한 저항력을 향상시킨다.
  • 예측 앙상블($E_p$)과 공격 앙상블($E_a$)이 다를 수 있도록 동적 앙상블 전략을 사용하여 전이성을 방해한다.
  • CIFAR-10, MNIST, Traffic Sign 데이터셋에서 $L_2$-노름을 사용한 타겟 및 언타겟 적대적 공격을 통해 강건성을 평가한다.
  • 다양한 공격 신뢰도 수준($Conf$) 하에서 정적 앙상블, 랜덤 앙상블, 표준 앙상블 적대적 훈련과 성능을 비교한다.
  • 청정 데이터에서의 정확도와 공격 하에서의 강건성 간 균형을 맞추기 위해 노이즈 표준편차($x$)를 최적화한다.

실험 결과

연구 질문

  • RQ1모델 선택 또는 모델 가중치의 랜덤라이제이션이 다양한 DNN 간 적대적 샘플의 전이성을 효과적으로 깰 수 있는가?
  • RQ2적대적 변형의 심각도(공격 예산)가 DNN에서 전이성 성공률에 어떤 영향을 미치는가?
  • RQ3추론 시점에 DNN를 랜덤으로 선택하는 것이 고정 또는 정적 앙상블에 비해 강건성을 크게 향상시키는가?
  • RQ4앙상블 훈련이나 적대적 데이터로의 재훈련 없이도 가중치 랜덤라이제이션만으로도 강력한 방어가 가능한가?
  • RQ5다양한 공격 신뢰도 수준에서 랜덤라이제이션 기반 방어의 성능이 앙상블 적대적 훈련과 어떻게 비교되는가?

주요 결과

  • DNN 가중치에 작은 가우시안 노이즈를 추가함으로써 청정 데이터에서 저예산 공격 하에서 적대적 공격에 대한 강건성이 최대 74.2% 향상되었다.
  • 각 쿼리 시 100개 모델 풀에서 랜덤으로 DNN를 선택함으로써 전이성 기반 공격의 성공률이 감소하였으며, 특히 $Conf=0$일 때 두드러졌다.
  • 동적 앙상블 전략($E_p \neq E_a$)은 정적 앙상블($E_p = E_a$)보다 뚜렷이 뛰어나며, 고변형 예산 하에서도 정확도가 유지되었다.
  • 가중치 랜덤라이제이션($x > 0$)은 높은 신뢰도 공격($Conf \geq 5$) 하에서 강건성을 향상시켰으며, 이는 표준 앙상블이 약한 구성 요소로 인해 실패한 경우였다.
  • MNIST 데이터셋이 랜덤라이제이션에 가장 높은 저항성을 보였고, 그 다음으로 CIFAR-10이었으며, Traffic Sign 데이터셋은 차분한 엔트로피로 인해 가장 영향을 덜 받았다.
  • 어떤 방어 기법도 무제한 변형 예산 공격을 완전히 저지하지 못했으며, 이는 전이성이 모델 설계의 본질적 특성보다 공격 심각도에 의해 제한됨을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.