Skip to main content
QUICK REVIEW

[논문 리뷰] On Certifying Robustness against Backdoor Attacks via Randomized Smoothing

Binghui Wang, Xiaoyu Cao|arXiv (Cornell University)|2020. 02. 26.
Adversarial Robustness in Machine Learning참고 문헌 28인용 수 59
한 줄 요약

본 논문은 훈련 및 예측을 기반 함수로 다루고 훈련 데이터, 테스트 데이터, 라벨에 노이즈를 추가하여 공격자 교란을 제약함으로써 백도어 공격에 대한 강건성을 인증하기 위해 난수 스무딩을 확장한다. 이론적 타당성을 보여주지만 기존의 스무딩 방법이 백도어에 대해 제한적 효과를 보인다고 밝혀 새로운 이론과 방법이 필요하다.

ABSTRACT

Backdoor attack is a severe security threat to deep neural networks (DNNs). We envision that, like adversarial examples, there will be a cat-and-mouse game for backdoor attacks, i.e., new empirical defenses are developed to defend against backdoor attacks but they are soon broken by strong adaptive backdoor attacks. To prevent such cat-and-mouse game, we take the first step towards certified defenses against backdoor attacks. Specifically, in this work, we study the feasibility and effectiveness of certifying robustness against backdoor attacks using a recent technique called randomized smoothing. Randomized smoothing was originally developed to certify robustness against adversarial examples. We generalize randomized smoothing to defend against backdoor attacks. Our results show the theoretical feasibility of using randomized smoothing to certify robustness against backdoor attacks. However, we also find that existing randomized smoothing methods have limited effectiveness at defending against backdoor attacks, which highlight the needs of new theory and methods to certify robustness against backdoor attacks.

연구 동기 및 목표

  • 백도어 공격에 대한 인증된 방어를 동기화하여 적응적 대 adversaries에 견딜 수 있도록 한다.
  • 적대적 강건성에서 백도어 강건성으로 난수 스무딩을 일반화한다.
  • 훈련 및 예측 과정을 캡처하는 기본 함수를 형식화하고 스무딩을 적용하여 강건성을 인증한다.
  • MNIST 부분 집합에서 접근 가능성과 한계를 평가한다.

제안 방법

  • 훈련 및 예측 과정을 기본 함수 f로 취급하고 이를 난수 스무딩하여 인증 반경이 있는 스무딩된 함수 g를 얻는다.
  • 가치가 이산 데이터에 대해 훈련 데이터 X, 라벨 y, 테스트 예제 x에 노이즈를 더하는 등 이산 노이즈 모델을 사용하여 디스크리트 데이터에 스무딩 프레임워크를 확장한다.
  • 몬테카를로 샘플링을 통해 Pr(f(v⊕ε)=l)의 하한 p_l를 추정하고 Clopper–Pearson을 사용하여 인증 반경 R(p_l)을 도출한다.
  • 교란 데이터셋(X⊕τ, y⊕ε) 하에서 N 개의 분류기를 학습하고 교란된 테스트 입력에 대한 예측을 평가하여 인증에 필요한 라벨 빈도를 계산한다.
  • Bonferroni 보정을 통해 테스트 샘플 전체에 걸쳐 동시 신뢰 보장을 제공한다.

실험 결과

연구 질문

  • RQ1훈련 및 예측 파이프라인 전체를 기본 함수로 간주하여 난수 스무딩이 백도어 공격에 대한 강건성을 인증할 수 있는가?
  • RQ2이산 데이터 및 백도어 스타일 교란 하에서 인증 반경은 얼마나 달성될 수 있는가?
  • RQ3가산 노이즈를 사용한 기존의 난수 스무딩 기법은 실무에서 백도어 위협을 완화하는 데 얼마나 효과적인가?
  • RQ4스무딩 기반 인증 방어의 이론적·실험적 한계는 무엇인가?

주요 결과

  • 본 논문은 난수 스무딩을 사용하여 백도어 공격에 대한 강건성을 인증하는 것이 이론적으로 가능하다고 제시한다.
  • MNIST 부분 집합에서 이 방법은 백도어 공격자가 교육 데이터의 최대 2개의 픽셀/라벨과 테스트 이미지의 픽셀을 교란하는 경우에도 테스트 이미지의 36%가 정확하게 분류되도록 강건성을 인증한다.
  • 평가된 설정에서 가산 노이즈를 사용하는 기존의 난수 스무딩 방법은 백도어 공격에 대해 제한된 효과를 보인다.
  • 백도어에 대한 인증을 개선하기 위한 새로운 이론과 방법의 필요성이 강조된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.