Skip to main content
QUICK REVIEW

[논문 리뷰] Mitigating Advanced Adversarial Attacks with More Advanced Gradient Obfuscation Techniques

Han Qiu, Yi Zeng|arXiv (Cornell University)|2020. 05. 27.
Adversarial Robustness in Machine Learning참고 문헌 46인용 수 14
한 줄 요약

이 논문은 BPDA 및 EOT 공격의 근본적 가정을 깨뜨리는 네 가지 핵심 성질을 강제함으로써 최신 기술의 기울기 기반 공격를 무력화하는 두 가지 고급 전처리 기능을 제안한다. 이 방법은 수십 시간에 걸친 GPU 연산 후에도 공격 성공률가 7% 이하로 유지되며, 정확성과 강건성 면에서 11개의 최신 기술 방어법을 모두 능가한다.

ABSTRACT

Deep Neural Networks (DNNs) are well-known to be vulnerable to Adversarial Examples (AEs). A large amount of efforts have been spent to launch and heat the arms race between the attackers and defenders. Recently, advanced gradient-based attack techniques were proposed (e.g., BPDA and EOT), which have defeated a considerable number of existing defense methods. Up to today, there are still no satisfactory solutions that can effectively and efficiently defend against those attacks. In this paper, we make a steady step towards mitigating those advanced gradient-based attacks with two major contributions. First, we perform an in-depth analysis about the root causes of those attacks, and propose four properties that can break the fundamental assumptions of those attacks. Second, we identify a set of operations that can meet those properties. By integrating these operations, we design two preprocessing functions that can invalidate these powerful attacks. Extensive evaluations indicate that our solutions can effectively mitigate all existing standard and advanced attack techniques, and beat 11 state-of-the-art defense solutions published in top-tier conferences over the past 2 years. The defender can employ our solutions to constrain the attack success rate below 7% for the strongest attacks even the adversary has spent dozens of GPU hours.

연구 동기 및 목표

  • BPDA 및 EOT과 같은 고급 기울기 기반 공격에 대비한 강건한 방어 기법의 부재를 보완하기 위해.
  • 현재 기울기 가로막기 방어 기법의 근본적 약점을 규명하여 BPDA 및 EOT 공격가 성공할 수 있는 이유를 밝히기 위해.
  • 기울기 기반 공격의 핵심 가정을 무너뜨리는 데 기여하는 네 가지 새로운 성질을 만족하는 전처리 기능을 설계하기 위해.
  • 강력한 강건성과 함께 높은 모델 정확도를 유지하는 것을 목표로 하기 위해.

제안 방법

  • 저자들은 BPDA 및 EOT 공격에 저항하기 위해 전처리 함수가 만족해야 할 네 가지 핵심 성질을 규명한다: (1) 입력 근사화 하에서의 비미분 가능성, (2) 입력 대체를 통한 근사 불가능성, (3) 평균화 하에서의 비확률성, (4) 변환 하에서의 식별 불가능성.
  • 비미분성 및 비확률성 변환과 같은 연산을 통합하여, 이 네 가지 성질을 모두 만족하는 두 가지 새로운 전처리 함수(FD 및 RDG)를 설계한다.
  • 함수들은 주요 DNN 모델 이전에 적용되어, 기울기 기반 공격가 BPDA 또는 EOT를 통해 기울기를 신뢰성 있게 추정하지 못하도록 한다.
  • 모델 재학습이나 파라미터 변경을 피함으로써 모델 파라미터 비밀유지 성질을 유지하고, 공격 표면을 최소화한다.
  • 이 방법은 전처리 기반이며 기존 모델과 호환되어 재학습 없이도 구현이 가능하다.
  • 이 접근법은 여러 데이터셋과 공격 유형에 대해 평가되었으며, 화이트박스 설정 하에서 표준 공격과 고급 공격 모두에 대해 검증되었다.

실험 결과

연구 질문

  • RQ1기울기 기반 공격의 핵심 가정을 무너뜨리는 방식으로 전처리 함수를 설계하여 BPDA 및 EOT 공격를 무력화할 수 있는가?
  • RQ2기울기 기반 악성 공격에 대비해 강건성을 유지하기 위해 전처리 함수가 만족해야 할 구체적인 성질은 무엇인가?
  • RQ3기존 방어 기법은 BPDA 및 EOT에 실패하는 이유가 무엇이며, 공통적으로 공유하는 근본적 결함는 무엇인가?
  • RQ4고정된 정확도를 유지하면서도 고급 공격에 대해 강력한 강건성을 확보할 수 있는가?
  • RQ5모든 네 가지 제안된 성질을 만족하는 단일 통합 전처리 함수를 설계할 수 있는가?

주요 결과

  • 제안된 FD+RDG 방어 기법은 공격자가 수십 시간에 걸쳐 GPU 자원을 투자하더라도 공격 성공률가 7% 이하로 낮아지며, 기존 방어 기법들보다 현저히 뛰어난 성능을 보였다.
  • 모델 정확도가 $l_2$-제한된 편향(0.05) 하에서도 58%를 유지하였으며, 테스트된 11개의 최신 기술 방어 기법보다 높았다.
  • 모든 이전 방어 기법은 네 가지 제안된 성질을 모두 만족하지 못했으며, 이는 BPDA 및 EOT에 취약한 이유를 설명한다.
  • FD+RDG 방어 기법은 BPDA 및 EOT 공격를 동시에 견딜 수 있으며, 종합적인 평가를 통해 확인되었다.
  • 기존 방법들과 달리, 이 방어 기법은 악성 훈련과 조합되어도 효과를 유지한다.
  • 규명된 네 가지 성질은 강건성에 필수적이며, 특히 #2, #3, #4 성질을 더 많이 만족하는 방어 기법일수록 현저히 높은 저항력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.