Skip to main content
QUICK REVIEW

[논문 리뷰] Data-free Backdoor Removal based on Channel Lipschitzness

Runkai Zheng, Rongjun Tang|arXiv (Cornell University)|2022. 08. 05.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 데이터 없이 배경 잡음 공격을 방어하는 데 사용할 수 있는 채널 리프시츠성 기반 프루닝(ChanneL Lipschitzness-based Pruning, CLP)을 제안한다. CLP는 오직 모델 가중치만을 사용하여 리프시츠 상수 값이 높은 채널(즉, 배경 잡음 트리거에 민감한 채널)을 식별하고 프루닝함으로써, 데이터 없이도 상태의 기술을 달성한다. 이는 정확도 저하가 최소화되고 매우 빠른 속도를 보이며, 훈련 데이터나 광범위한 하이퍼파rameter 튜닝 없이도 기존의 방법들을 능가한다.

ABSTRACT

Recent studies have shown that Deep Neural Networks (DNNs) are vulnerable to the backdoor attacks, which leads to malicious behaviors of DNNs when specific triggers are attached to the input images. It was further demonstrated that the infected DNNs possess a collection of channels, which are more sensitive to the backdoor triggers compared with normal channels. Pruning these channels was then shown to be effective in mitigating the backdoor behaviors. To locate those channels, it is natural to consider their Lipschitzness, which measures their sensitivity against worst-case perturbations on the inputs. In this work, we introduce a novel concept called Channel Lipschitz Constant (CLC), which is defined as the Lipschitz constant of the mapping from the input images to the output of each channel. Then we provide empirical evidences to show the strong correlation between an Upper bound of the CLC (UCLC) and the trigger-activated change on the channel activation. Since UCLC can be directly calculated from the weight matrices, we can detect the potential backdoor channels in a data-free manner, and do simple pruning on the infected DNN to repair the model. The proposed Channel Lipschitzness based Pruning (CLP) method is super fast, simple, data-free and robust to the choice of the pruning threshold. Extensive experiments are conducted to evaluate the efficiency and effectiveness of CLP, which achieves state-of-the-art results among the mainstream defense methods even without any data. Source codes are available at https://github.com/rkteddy/channel-Lipschitzness-based-pruning.

연구 동기 및 목표

  • 훈련 데이터가 가용하지 않을 때 배경 잡음 공격에 대응하는 데 도전하는 것.
  • 입력 데이터에 접근할 수 없이 DNN 내의 배경 잡음 트리거에 민감한 채널을 식별하는 것.
  • 정확도를 유지하면서도 빠르고 강력하며 데이터 없는 방어 메커니즘을 개발하는 것.
  • 채널 리프시츠성과 배경 잡음 취약성 간의 이론적이고 경험적인 연결 고리를 구축하는 것.
  • 다양한 CNN 아키텍처와 배경 잡음 공격 유형에 일반화 가능한 가벼운 방어 기법을 제공하는 것.

제안 방법

  • 각 채널의 입력 변형에 대한 민감도를 측정하기 위해 채널 리프시츠 상수(Channel Lipschitz Constant, CLC)를 도입한다.
  • 모델 가중치 행렬에서 직접 CLC의 상한값(Upper Bound of CLC, UCLC)을 유도함으로써, 데이터 없이도 계산이 가능하도록 한다.
  • 정상적으로 높은 UCLC 값을 가지는 채널을 잠재적인 배경 잡음 유전자로 식별한다.
  • 이러한 고UCLC 채널을 프루닝하여 배경 잡음 행동을 무력화한다.
  • 프루닝된 채널 수를 제어하기 위해 상대적 프루닝 임계값 $u$를 사용하며, 이 값의 선택에 대해 매우 민감하지 않다.
  • 재학습을 피하고 계산이 효율적인, 데이터 없이 가중치만을 사용하는 접근 방식을 채택한다.

실험 결과

연구 질문

  • RQ1채널 수준의 리프시츠 상수는 DNN 내에서 배경 잡음 트리거 민감도를 신뢰할 수 있는 지표로 작용할 수 있는가?
  • RQ2훈련 데이터에 접근할 수 없이도 배경 잡음 채널을 탐지하고 제거하는 것이 가능한가?
  • RQ3제안된 UCLC 기반 프루닝은 기존의 데이터 없는 방어 방법과 데이터 의존적 방어 방법에 비해 정확도와 강건성 측면에서 어떻게 비교되는가?
  • RQ4이 방법의 성능는 프루닝 임계값 $u$의 선택에 얼마나 민감한가?
  • RQ5이 방법은 다양한 CNN 아키텍처와 다양한 배경 잡음 공격 유형으로 일반화 가능한가?

주요 결과

  • CIFAR-10에서 ResNet-18을 사용한 실험에서, CLP는 10%의 오염 비율 조건에서도 모든 테스트된 배경 잡음 공격에 대해 공격 성공률(ASR)을 3% 이하로 낮추며, 정상 정확도는 93% 이상 유지한다.
  • CIFAR-10에서 ResNet-18을 사용한 결과, CLP는 BadNets (A2O)의 ASR를 100%에서 1.38%로, BadNets (A2A)는 1.06%로, Trojan는 0.92%로 낮추었으며, 정상 정확도는 단지 0.4% 감소하였다.
  • CPU를 사용해 500장의 CIFAR-10 이미지에 대해 CLP의 런타임은 단 2.87초로, 다음으로 빠른 방법보다 약 5배 빠르다.
  • 프루닝 임계값 $u$에 대한 민감도가 낮아, 다양한 아키텍처에서 $u$가 3에서 4 사이일 때 최적의 성능가 관찰되었다.
  • CLP는 다양한 아키텍처로의 일반화가 잘 되어 있으며, VGG와 SENet는 ResNet보다 $u$에 대해 더 강건한 성능를 보이며, 넓은 적용 가능성을 입증하였다.
  • 높은 오염 비율(최대 10%) 조건에서도 CLP는 높은 성능를 유지하며 대부분의 공격에서 ASR를 3% 이하로 낮추었으며, 데이터 오염 수준에 대한 강력한 저항성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.