Skip to main content
QUICK REVIEW

[논문 리뷰] SPECTRE: Defending Against Backdoor Attacks Using Robust Statistics

Jonathan Hayase, Weihao Kong|arXiv (Cornell University)|2021. 04. 22.
Adversarial Robustness in Machine Learning참고 문헌 51인용 수 12
한 줄 요약

SPECTRE는 강력한 공분산 추정과 화이트닝을 통해 오염된 데이터의 스펙트럼 서명을 증폭시켜, 이전 방법이 실패하는 저오염 비율에서도 효과적인 백도어 탐지 및 제거가 가능한 강력한 방어 기법을 제안한다. 이는 다양한 공격 유형에서 완전한 백도어 제거를 달성하며, 최신 기법들보다 뚜렷이 뛰어난 성능을 보인다.

ABSTRACT

Modern machine learning increasingly requires training on a large collection of data from multiple sources, not all of which can be trusted. A particularly concerning scenario is when a small fraction of poisoned data changes the behavior of the trained model when triggered by an attacker-specified watermark. Such a compromised model will be deployed unnoticed as the model is accurate otherwise. There have been promising attempts to use the intermediate representations of such a model to separate corrupted examples from clean ones. However, these defenses work only when a certain spectral signature of the poisoned examples is large enough for detection. There is a wide range of attacks that cannot be protected against by the existing defenses. We propose a novel defense algorithm using robust covariance estimation to amplify the spectral signature of corrupted data. This defense provides a clean model, completely removing the backdoor, even in regimes where previous methods have no hope of detecting the poisoned examples. Code and pre-trained models are available at https://github.com/SewoongLab/spectre-defense .

연구 동기 및 목표

  • 오직 소수의 데이터 포인트만 오염된 경우 기존 방어 기법이 실패하는 심각한 격차를 보완하기 위해.
  • 스펙트럼 서인이 약하거나 주성분과 일치하지 않는 경우 백도어 예측값을 개선하기 위해.
  • 다양한 백도어 공격 유형과 강도에 일반적으로 적용 가능한 강력한 일반 목적 방어 기법을 개발하기 위해.
  • 청정 데이터 정확도를 손상시키지 않은 채 백도어를 완전히 제거하기 위해.

제안 방법

  • 오염된 예시로부터의 오염 영향을 줄이기 위해 청정 데이터의 평균과 공분산을 강력한 통계 추정 기법을 사용해 추정한다.
  • 강력하게 추정된 공분산을 사용해 훈련 데이터의 중간 표현을 화이트닝하여 청정 및 오염된 샘플 간의 스펙트럼 차이를 증폭시킨다.
  • 화이트닝된 표현에 대해 강력한 주성분 분석(PCA)을 적용해 오염된 데이터와 청정 데이터를 분리하는 방향과 일치하는 최상위 주성분을 식별한다.
  • 청정 부분공간에서의 편차를 기반으로 샘플을 순위 매기는 데 사용되는 새로운 이상치 점수 기법인 QUantum Entropy(QUE)를 도입한다.
  • QUE 점수 기반으로 상위 순위의 샘플(가장 높은 QUE 점수를 가진 샘플)을 제거하여 재학습 전에 오염된 데이터를 필터링한다.
  • 필터링된 데이터로 모델을 재학습시켜 청정하고 백도어가 없는 모델을 생성한다.

실험 결과

연구 질문

  • RQ1강력한 공분산 추정이 저오염 비율 환경에서 오염된 데이터의 스펙트럼 서명을 효과적으로 증폭시킬 수 있는가?
  • RQ2강력한 화이트닝이 최상위 PCA 방향이 진짜로 청정 및 오염된 데이터를 분리하는 방향과 잘 일치하도록 개선되는가?
  • RQ3단일 방어 프레임워크가 다양한 백도어 공격 유형과 강도에 일반화될 수 있는가?
  • RQ4이상치 점수 기법의 선택이 다양한 공격 조건에서 탐지 성능에 어떤 영향을 미치는가?
  • RQ5SPECTRE는 기존 방어 기법 대비 백도어 제거 능력과 청정 데이터 정확도 측면에서 어느 정도 뛰어나게 성능을 발휘하는가?

주요 결과

  • SPECTRE는 기존 방어 기법이 실패하는 모든 테스트 환경에서 백도어를 성공적으로 제거한다(예: CIFAR-10에서 125개의 오염된 예제가 존재하는 경우).
  • 재학습 후 공격 정확도가 0%로 떨어져, 오염된 샘플 수가 64개에 불과한 경우에도 완전한 백도어 제거가 이루어짐을 확인했다.
  • 강력한 화이트닝이 최상위 PCA 방향이 진짜 데이터 분리 방향과 잘 일치하도록 개선되어 신뢰할 수 있는 탐지가 가능해졌다.
  • QUE 이상치 점수 기법은 1-way 및 3-way 픽셀 공격을 포함한 다양한 공격 유형에서 표준 제곱노름 및 투영된 노름 점수 기법보다 뛰어난 성능을 보였다.
  • 절단 실험을 통해 강력한 추정, 화이트닝, QUE 점수 기법이 모두 방어 기법의 성공에 필수적임을 확인했다.
  • 제거하는 샘플 수의 변화에 대해 유연하게 대응하며 다양한 제거 임계값에서도 높은 성능 유지를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.