Skip to main content
QUICK REVIEW

[논문 리뷰] Random Noise Defense Against Query-Based Black-Box Attacks

Zeyu Qin, Yanbo Fan|arXiv (Cornell University)|2021. 04. 23.
Adversarial Robustness in Machine Learning참고 문헌 50인용 수 7
한 줄 요약

이 논문은 추론 시 간섭을 유도하기 위해 가우시안 노이즈를 추가하는 경량이며 플러그 앤 플레이인 Random Noise Defense (RND)를 제안한다. 이론적 분석은 방어 성능이 RND와 공격자에 의해 유도된 노이즈 간의 노이즈 크기 비율에 달려 있음을 보여주며, RND-GF—RND에 가우시안 증강 미세조정을 결합한 방식—은 적대적 훈련만으로는 달성할 수 없는 최대 23.1% 높은 강건한 정확도를 달성하면서도 청소 정확도를 유지한다.

ABSTRACT

The query-based black-box attacks have raised serious threats to machine learning models in many real applications. In this work, we study a lightweight defense method, dubbed Random Noise Defense (RND), which adds proper Gaussian noise to each query. We conduct the theoretical analysis about the effectiveness of RND against query-based black-box attacks and the corresponding adaptive attacks. Our theoretical results reveal that the defense performance of RND is determined by the magnitude ratio between the noise induced by RND and the noise added by the attackers for gradient estimation or local search. The large magnitude ratio leads to the stronger defense performance of RND, and it's also critical for mitigating adaptive attacks. Based on our analysis, we further propose to combine RND with a plausible Gaussian augmentation Fine-tuning (RND-GF). It enables RND to add larger noise to each query while maintaining the clean accuracy to obtain a better trade-off between clean accuracy and defense performance. Additionally, RND can be flexibly combined with the existing defense methods to further boost the adversarial robustness, such as adversarial training (AT). Extensive experiments on CIFAR-10 and ImageNet verify our theoretical findings and the effectiveness of RND and RND-GF.

연구 동기 및 목표

  • 청소 정확도를 저하시키지 않으면서 쿼리 기반 블랙박스 공격에 대비하는 경량이고 효율적인 방어 기법을 개발하는 것.
  • 표준 및 적응형 쿼리 기반 공격에 대해 랜덤 노이즈 방어(RND)의 효과성을 이론적으로 분석하는 것.
  • 더 큰 노이즈 주입이 성능 저하 없이 가능하도록 강건성과 청소 정확도 간의 상충 관계를 해결하는 것.
  • 이미 존재하는 기법들(예: 적대적 훈련)과 조합할 수 있는 플러그 앤 플레이 방어 기법을 설계하는 것.
  • 이론적 결과를 경험적으로 검증하고, CIFAR-10 및 ImageNet에서 RND와 RND-GF의 우수성을 입증하는 것.

제안 방법

  • RND는 추론 시 간섭을 유도하기 위해 가우시안 노이즈를 주입하여 쿼리 기반 공격에서 기울기 추정과 무작위 탐색을 방해한다.
  • 방어 성능은 기울기 추정 또는 탐색에서 RND 노이즈와 공격자 노이즈 간의 크기 비율과 이론적으로 연관되어 있다.
  • RND-GF는 RND와 가벼운 가우시안 증강 미세조정을 조합하여 더 큰 노이즈 주입이 가능하면서도 청소 정확도를 유지하도록 한다.
  • 이론적 분석은 노이즈 크기 비율이 충분히 클 경우 적응형 공격(예: EOT)이 RND를 피하기 어려운 것으로 확인한다.
  • RND는 기존의 방어 기법들(예: 적대적 훈련(AT))과의 통합이 가능하도록 설계되어 플러그 앤 플레이 방식을 구현한다.
  • 실험은 Square, Bandit, SimBA와 같은 최신 쿼리 기반 공격을 사용하여 CIFAR-10 및 ImageNet에서 RND와 RND-GF를 평가한다.

실험 결과

연구 질문

  • RQ1RND에 의해 유도된 노이즈와 공격자에 의해 유도된 노이즈 간의 크기 비율이 방어 성능에 어떻게 영향을 미치는가?
  • RQ2RND는 Expectation of Perturbations(EOT)와 같은 적응형 공격을 효과적으로 완화할 수 있는가?
  • RQ3RND는 기존의 방어 기법들(예: 적대적 훈련)과 조합하여 강건성을 추가로 향상시킬 수 있는가?
  • RQ4RND-GF는 표준 RND에 비해 청소 정확도와 적대적 강건성 간의 상호 보완적 관계를 더 잘 달성하는가?
  • RQ5RND는 스코어 기반 및 탐색 기반 공격 전략을 포함한 다양한 쿼리 기반 공격 전략에 대해 어떻게 작용하는가?

주요 결과

  • CIFAR-10 및 ImageNet에서 RND는 AT와 조합될 경우, 단독으로 적대적 훈련을 사용할 때보다 최대 23.1% 높은 강건한 정확도를 달성한다.
  • RND-GF는 청소 정확도를 높게 유지(예: CIFAR-10에서 71.15%)하면서도 ZO 및 탐색 기반 공격에 대해 특히 뛰어난 방어 성능을 보인다.
  • Square 공격에 대해 RND-AT는 CIFAR-10에서 AT만 사용할 경우 대비 23.1% 향상된 강건한 정확도를 기록했고, ImageNet에서는 22.7% 향상되었다.
  • Bandit, SimBA, ECO 공격에 대해 RND는 성공률를 감소시키고, 필요한 쿼리 수를 증가시켜 적응형 전략에 대한 강력한 저항력을 보였다.
  • 이론적 예측인 큰 노이즈 크기 비율이 방어 성능을 향상시킨다는 것은 경험적으로 검증되었으며, RND-GF는 정확도 저하 없이 더 큰 노이즈 주입을 가능하게 했다.
  • RND는 다양한 공격 유형에 효과적이며, 다른 방어 기법과 조합되어도 강건성을 유지함으로써 플러그 앤 플레이 성격과 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.