Skip to main content
QUICK REVIEW

[논문 리뷰] Post-Training Detection of Backdoor Attacks for Two-Class and Multi-Attack Scenarios

Zhen Xiang, David J. Miller|arXiv (Cornell University)|2022. 01. 20.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 두 클래스 및 다중 공격 시나리오를 위한 새로운 후기반 백도어 공격 탐지 프레임워크를 제안하며, 백도어 패턴(BP) 역설계와 새로운 기대 전이 가능성(ET) 통계량을 사용한다. ET 통계량은 단일의 도메인 무관 임계값을 사용하여 효과적인 탐지가 가능하게 하여, 훈련 데이터나 정제된 기준 분류기의 접근이 없이도 여섯 가지 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Backdoor attacks (BAs) are an emerging threat to deep neural network classifiers. A victim classifier will predict to an attacker-desired target class whenever a test sample is embedded with the same backdoor pattern (BP) that was used to poison the classifier's training set. Detecting whether a classifier is backdoor attacked is not easy in practice, especially when the defender is, e.g., a downstream user without access to the classifier's training set. This challenge is addressed here by a reverse-engineering defense (RED), which has been shown to yield state-of-the-art performance in several domains. However, existing REDs are not applicable when there are only {\it two classes} or when {\it multiple attacks} are present. These scenarios are first studied in the current paper, under the practical constraints that the defender neither has access to the classifier's training set nor to supervision from clean reference classifiers trained for the same domain. We propose a detection framework based on BP reverse-engineering and a novel {\it expected transferability} (ET) statistic. We show that our ET statistic is effective {\it using the same detection threshold}, irrespective of the classification domain, the attack configuration, and the BP reverse-engineering algorithm that is used. The excellent performance of our method is demonstrated on six benchmark datasets. Notably, our detection framework is also applicable to multi-class scenarios with multiple attacks. Code is available at https://github.com/zhenxianglance/2ClassBADetection.

연구 동기 및 목표

  • 기존의 역설계 방어 기법(REDs)이 비표적 클래스의 통계가 부족하여 근본 분포 추정에 실패하는 두 클래스 및 다중 공격 시나리오에서 백도어 공격을 탐지하는 데 도전하는 것.
  • 피해자 분류기의 훈련 세트에 접근할 수 없고, 동일 도메인에서 훈련된 정제된 기준 분류기로부터의 감독도 없는 실용적 조건에서 작동하는 탐지 방법을 개발하는 것.
  • 이전의 REDs가 적용 불가능하거나 성능이 저하되는 저클래스 시나리오(K=2 등)와 다중 공격 설정에서 신뢰할 수 있는 탐지 기능을 제공하는 것.
  • 다양한 분류 도메인, 공격 구성, 역설계 알고리즘에 걸쳐 통용 가능한 탐지 임계값을 확립하는 것.

제안 방법

  • 각 클래스에 대해 독립적으로 기존 또는 향후 개발될 수 있는 역설계 기법을 사용하여 백도어 패턴(BP)을 역설계하는 탐지 프레임워크를 제안한다.
  • 기대 전이 가능성(ET)이라는 새로운 탐지 통계량을 도입하며, 이는 정제된 테스트 샘플들에 대해 역설계된 BP의 평균 전이 가능성으로 정의된다.
  • ET를 이상치 점수로 사용: ET > 1/2 이면 해당 클래스가 백도어 공격을 당한 것으로 간주한다. 이는 진짜 백도어 패턴이 무작위 패턴보다 더 잘 전이된다는 사실을 활용한다.
  • 1/2의 단일 탐지 임계값이 모든 테스트 도메인, 공격 유형, 역설계 방법에서 효과적임을 입증하여 도메인 별 캘리브레이션의 필요성을 제거한다.
  • 두 클래스 및 다중 클래스 시나리오 모두에 적용하며, 동시에 여러 공격이 발생하는 경우도 포함한다.
  • 분류기 앙상블을 사용하여 강건성 향상과 일관된 탐지 성능 확보

실험 결과

연구 질문

  • RQ1기존의 REDs가 비표적 클래스 통계가 부족하여 근본 분포 추정에 실패하는 두 클래스 시나리오에서, 백도어 탐지 프레임워크가 효과적으로 작동할 수 있는가?
  • RQ2다양한 데이터셋, 공격 유형, 역설계 알고리즘에 걸쳐 통용 가능한 백도어 탐지 임계값이 존재하는가?
  • RQ3제안된 기대 전이 가능성(ET) 통계량이 공격 수나 성격에 대한 사전 지식 없이도 다중 공격 시나리오에서 백도어 공격을 탐지할 수 있는가?
  • RQ4다중 공격 조건에서 기존의 RED 방법에 비해 제안된 ET 기반 프레임워크의 탐지 정확도와 위양성 비율은 어떻게 비교되는가?

주요 결과

  • 제안된 ET 기반 탐지 프레임워크는 한 개의 공격이 있는 10개의 5클래스 도메인과 두 개의 공격이 있는 10개의 도메인에서 모두 100% 탐지 정확도를 달성했으며, 위양성은 전혀 없었다.
  • 원본 RED-AP 및 RED-AP (MAD) 기반 방법보다 뛰어난 성능을 보였으며, 이는 두 공격 사례를 전혀 탐지하지 못했던 점을 감안할 때 다중 공격 환경에서의 강건성을 입증한다.
  • 1/2의 탐지 임계값이 여섯 가지 벤치마크 데이터셋, 다양한 공격 구성, 여러 역설계 알고리즘에 걸쳐 통용 가능하여 도메인 별 캘리브레이션의 필요성을 제거한다.
  • 위양성은 흔치 않으며, 주로 RE-PR 방법을 사용해 정제된 분류기를 역설계할 경우에만 발생하지만, 이 경우에도 다양한 두 클래스 도메인에서 낮은 빈도로만 발생한다.
  • ET 통계량은 BP 유형, 역설계 목표 함수, 최적화 기법의 변동에 대해 강건하여 기존 및 향후 개발될 수 있는 역설계 기법과의 호환성을 보장한다.
  • 이 프레임워크는 두 클래스 및 다중 클래스 시나리오, 다중 동시 공격이 발생하는 경우까지도 백도어 공격을 성공적으로 탐지하여 광범위한 적용 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.