[논문 리뷰] Neural Attention Distillation: Erasing Backdoor Triggers from Deep Neural Networks
본 논문은 Neural Attention Distillation(NAD)을 제안하는데, 이는 교사 네트워크를 이용해 백도어가 있는 학생 네트워크의 파인튜닝을 안내하여 어텐션 맵을 일치시키는 증류 기반 방어입니다; NAD는 여러 공격에 대해 단 5%의 깨끗한 데이터만으로도 백도어 트리거를 사실상 지워내고 깨끗한 정확도를 유지합니다.
Deep neural networks (DNNs) are known vulnerable to backdoor attacks, a training time attack that injects a trigger pattern into a small proportion of training data so as to control the model's prediction at the test time. Backdoor attacks are notably dangerous since they do not affect the model's performance on clean examples, yet can fool the model to make incorrect prediction whenever the trigger pattern appears during testing. In this paper, we propose a novel defense framework Neural Attention Distillation (NAD) to erase backdoor triggers from backdoored DNNs. NAD utilizes a teacher network to guide the finetuning of the backdoored student network on a small clean subset of data such that the intermediate-layer attention of the student network aligns with that of the teacher network. The teacher network can be obtained by an independent finetuning process on the same clean subset. We empirically show, against 6 state-of-the-art backdoor attacks, NAD can effectively erase the backdoor triggers using only 5\% clean training data without causing obvious performance degradation on clean examples. Code is available in https://github.com/bboylyg/NAD.
연구 동기 및 목표
- 백도어 공격에서 트리거가 깨끗한 정확도에는 영향을 주지 않으면서 예측을 가로채는 경우에도 강건한 방어를 모티브로 삼는다.
- 지식 증류와 신경 주의 전송을 이용한 파인튜닝 프레임워크를 개발하여 백도어 트리거를 지운다.
- 제한된 깨끗한 데이터로 NAD가 여러 백도어 공격 유형에서도 작동하고 깨끗한 정확도를 유지하는지 보여준다.
제안 방법
- 레이어 활성화로부터 어텐션 맵을 생성하는 어텐션 연산자 A를 정의한다.
- 교사와 학생 어텐션 맵 간의 정규화된 L2 거리를 잇따른 잔차 그룹 전체에서 계산하는 NAD 손실(Equation 2)을 구한다.
- 작은 깨끗한 데이터 부분집합에서 백도어 모델을 파인튜닝하여 교사 네트워크를 학습시킨다.
- 학생의 교차 엔트로피 손실과 NAD 손실을 결합한 총 손실 L_total을 최적화한다(Equation 3).
- 5%의 깨끗한 데이터와 SGD를 사용한 10개의 학습 에폭으로 학생을 파인튜닝하고 교사를 구성한다.
실험 결과
연구 질문
- RQ1NAD가 다양한 백도어 공격에서 최소한의 깨끗한 데이터로 백도어 트리거를 제거할 수 있는가?
- RQ2주의 기반 증류가 표준 파인튜닝 및 다른 지우기 방법에 비해 ASR 및 깨끗한 ACC 측면에서 어떤 차이를 보이는가?
- RQ3어떤 주의 표현 및 교사-학생 구성 방식이 최적의 지우기 성능을 낳는가?
주요 결과
- NAD는 평균 공격 성공률(ASR)을 약 99–100%에서 약 7.2%로 축소시키고, 깨끗한 정확도 감소는 약 2.7% 수준으로 최소화합니다.
- 공격 유형 중에서 NAD는 백도어를 지우는 데 있어 표준 파인튜닝, 파인-프루닝, 모드 연결 수리 등을 지속적으로 능가합니다.
- 주의 기반 증류(A_sum^2 등)가 직접 피처 증류보다 백도어 제거가 강하고 백도어 영역과 정상 영역 간의 구분이 더 명확합니다.
- NAD는 몇 에폭의 빠른 수렴이 가능하며 다양한 교사-학생 아키텍처 선택 및 깨끗한 데이터 양의 변화에도 효과적으로 작동합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.