[논문 리뷰] Watch Out! Simple Horizontal Class Backdoor Can Trivially Evade Defense
이 논문은 무해하고 작업과 관련이 없는 특징(예: 날씨 조건, 표정)을 이용해 백도어를 활성화하는 새로운 수평 클래스 백도어(HCB) 공격을 제안한다. 이 공격은 간단한 트리거와 함께 조합되었을 때에만 작동하며, 수직 클래스 백도어와 달리 테스트한 9종의 최신 방어 기법을 모두 회피한다. 이는 현재 백도어 탐지 기법에 심각한 눈멀음이 있음을 드러낸다.
All current backdoor attacks on deep learning (DL) models fall under the category of a vertical class backdoor (VCB) -- class-dependent. In VCB attacks, any sample from a class activates the implanted backdoor when the secret trigger is present. Existing defense strategies overwhelmingly focus on countering VCB attacks, especially those that are source-class-agnostic. This narrow focus neglects the potential threat of other simpler yet general backdoor types, leading to false security implications. This study introduces a new, simple, and general type of backdoor attack coined as the horizontal class backdoor (HCB) that trivially breaches the class dependence characteristic of the VCB, bringing a fresh perspective to the community. HCB is now activated when the trigger is presented together with an innocuous feature, regardless of class. For example, the facial recognition model misclassifies a person who wears sunglasses with a smiling innocuous feature into the targeted person, such as an administrator, regardless of which person. The key is that these innocuous features are horizontally shared among classes but are only exhibited by partial samples per class. Extensive experiments on attacking performance across various tasks, including MNIST, facial recognition, traffic sign recognition, object detection, and medical diagnosis, confirm the high efficiency and effectiveness of the HCB. We rigorously evaluated the evasiveness of the HCB against a series of eleven representative countermeasures, including Fine-Pruning (RAID 18'), STRIP (ACSAC 19'), Neural Cleanse (Oakland 19'), ABS (CCS 19'), Februus (ACSAC 20'), NAD (ICLR 21'), MNTD (Oakland 21'), SCAn (USENIX SEC 21'), MOTH (Oakland 22'), Beatrix (NDSS 23'), and MM-BD (Oakland 24'). None of these countermeasures prove robustness, even when employing a simplistic trigger, such as a small and static white-square patch.
연구 동기 및 목표
- 기존 방어 기법을 회피할 수 있도록 천연적으로 존재하는 작업과 관련 없는 특징을 이용하는 새로운 유형의 백도어 공격을 식별하고 실험적으로 입증하는 것.
- 모든 백도어 공격이 수직 클래스 백도어(VCB)에 기반한다 는 가정을 도전하는 것. 이는 현재 방어 기법의 기초가 되는 가정이다.
- 기존 방어 기법이 주로 소스 클래스에 관계없이 또는 소스 클래스에 특화된 백도어를 대상으로 설계되어 있음에도 불구하고, 새로운 단순하고 일반적인 백도어 유형에 취약함을 드러내는 것.
- 특히 소스 클래스 특화 백도어(Scab)를 중심으로 한 대응 기법이 널리 사용되고 있음에도 불구하고, VCB 공격에 편향되지 않은 방어 기법 개발을 촉구하는 것.
제안 방법
- 백도어는 특정 클래스에서 자연스럽게 존재하는 작업과 관련 없는 특징(예: 교통 표지판 인식에서의 비, 얼굴 인식에서의 미소)이 존재하고, 동시에 트리거가 포함된 샘플에서만 활성화되는 수평 클래스 백도어(HCB) 공격을 제안한다.
- 복잡한 트리거 설계가 아니라 수평 클래스 구조 자체에 의해 회피 능력이 결정됨을 보여주기 위해 단순한 정적 흰색 사각형 트리거를 사용한다.
- 효과적인 샘플을 정의한다. 이는 어떤 클래스에서든 무해한 특징과 트리거가 모두 포함된 샘플을 의미하며, 이들 샘플만이 백도어를 활성화한다.
- 특정 소스 클래스에서만 백도어가 활성화되도록 하는 HCB의 변종을 도입하여, 비소스 클래스 샘플의 거짓 경고율(FPR)을 낮추고 안정적으로 유지한다.
- MNIST, 얼굴 인식, GTSRB, 객체 검출 작업에 표준 딥러닝 모델(CNN 등)을 사용하여 공격 성능을 평가한다.
- 모델 및 데이터 외주화 환경에서 HCB를 9종의 최신 방어 기법(예: Neural Cleanse, STRIP, MOTH)에 대해 평가하여 회피 능력을 시험한다.
실험 결과
연구 질문
- RQ1수직 클래스에 의존하지 않는 백도어 공격 유형이 존재하는가? 이러한 공격은 VCB 공격을 대상으로 한 방어 기법을 회피할 수 있는가?
- RQ2천연적으로 존재하는 작업과 관련 없는 특징(예: 날씨, 표정)을 이용해 일반적이고 은밀한 백도어 공격을 만들 수 있는가?
- RQ3고도의 탐지 기법을 사용하고도 기존 최신 방어 기법이 제안된 HCB 공격을 실패로 이끄는 이유는 무엇인가?
- RQ4HCB는 다양한 트리거 유형(예: 왜곡, 반사)과 백도어 변종(예: 소스 클래스 특화)으로 얼마나 일반화될 수 있는가?
- RQ5HCB가 현재 방어 기법을 회피하는 모델 및 데이터 외주화 환경에서 가능한 보완 전략은 무엇인가?
주요 결과
- HCB 공격는 MNIST, 얼굴 인식, 교통 표지판 인식, 객체 검출 등 모든 평가된 작업에서 거의 완벽한 공격 성공률(ASR > 95%)을 달성한다.
- 단순한 흰색 사각형 트리거를 사용할 때, Fine-Pruning, STRIP, Neural Cleanse, ABS, Februus, MNTD, SCAn, MOTH, Beatrix를 포함한 9종의 최신 방어 기법이 모두 HCB 공격를 탐지하거나 완화하지 못했다.
- 같은 무해한 특징을 사용해 훈련한 모델에 대해서도 방어 기법이 적용되었을 때 HCB 공격가 여전히 효과가 유지됨을 확인하여, 수평 클래스 구조가 클래스 조건부 탐지 기법의 기반을 약화시킴을 입증한다.
- HCB에 소스 클래스 특화 행동을 추가함으로써 높은 ASR(>85%)를 유지하면서도 비소스 클래스 샘플의 거짓 경고율(FPR)은 낮고 안정적으로 유지된다.
- 백색 사각형 트리거가 가장 높은 ASR를 기록하며, 왜곡, 반사 등 다른 트리거 유형과 비교해도 성능이 유사하여 트리거 변형에 대해 뛰어난 내구성을 보인다.
- HCB 공격는 정적 트리거에 국한되지 않으며, 동적 또는 복합 트리거로도 확장 가능하여 일반성과 적응 가능성의 높음을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.