Skip to main content
QUICK REVIEW

[논문 리뷰] Training with More Confidence: Mitigating Injected and Natural Backdoors During Training

Zhenting Wang, Hailun Ding|arXiv (Cornell University)|2022. 02. 13.
Adversarial Robustness in Machine Learning인용 수 12
한 줄 요약

이 논문은 깊이 신경망에서 주입된 배경과 자연적 백도어를 모두 완화하기 위해 조각별 선형 활성화 함수에 의해 유도되는 초평면 결정 영역을 탐지하고 제거하는 새로운 훈련 방법 NONE을 제안한다. 훈련 중 이러한 초평면을 형성하는 뉴런을 식별하고 억제함으로써, NONE은 표준 오염 공격 하에서 공격 성공률(ASR)을 54.83× 감소시키고 자연적 백도어 하에서는 1.75× 감소시키며, 다섯 개의 데이터셋과 다양한 공격 유형에서 기존 방어 방법을 능가한다.

ABSTRACT

The backdoor or Trojan attack is a severe threat to deep neural networks (DNNs). Researchers find that DNNs trained on benign data and settings can also learn backdoor behaviors, which is known as the natural backdoor. Existing works on anti-backdoor learning are based on weak observations that the backdoor and benign behaviors can differentiate during training. An adaptive attack with slow poisoning can bypass such defenses. Moreover, these methods cannot defend natural backdoors. We found the fundamental differences between backdoor-related neurons and benign neurons: backdoor-related neurons form a hyperplane as the classification surface across input domains of all affected labels. By further analyzing the training process and model architectures, we found that piece-wise linear functions cause this hyperplane surface. In this paper, we design a novel training method that forces the training to avoid generating such hyperplanes and thus remove the injected backdoors. Our extensive experiments on five datasets against five state-of-the-art attacks and also benign training show that our method can outperform existing state-of-the-art defenses. On average, the ASR (attack success rate) of the models trained with NONE is 54.83 times lower than undefended models under standard poisoning backdoor attack and 1.75 times lower under the natural backdoor attack. Our code is available at https://github.com/RU-System-Software-and-Security/NONE.

연구 동기 및 목표

  • 기존 방어 방법이 동시에 완화하지 못하는 깊이 신경망 내 주입 및 자연적 백도어의 심각한 위협을 해결하기 위해.
  • 특히 조각별 선형 활성화 함수(예: ReLU)와 관련된 DNN 내 백도어 유도 초평면 결정 영역의 근본 원인을 규명하기 위해.
  • 후처리 분석이나 모델 재학습이 필요 없이, 훈련 시점에서 이러한 초평면의 형성을 사전에 방지할 수 있는 방어 기법을 개발하기 위해.
  • 적응형 공격 및 페더레이티드 학습과 전이 학습을 포함한 실제 배포 환경에서도 강건성을 확보하기 위해.

제안 방법

  • 모든 영향을 받는 레이블에 걸쳐 입력 공간에서 초평면을 형성하는 뉴런을 식별함으로써 백도어 관련 뉴런을 탐지한다. 이는 트로이 악성 코드 트리거 영역에 해당한다.
  • 조각별 선형 활성화 함수(예: ReLU)는 가중치와 편향이 뉴런 입력을 단일 부분 함수로 제약할 경우 선형 결정 경계를 유도할 수 있다는 성질을 활용한다.
  • 훈련 중 활성화 값의 동태를 모니터링하고, 다양한 입력에서 일관되게 단일 선형 영역에 속하는 전활성화 값이 나타나는 뉴런을 억제한다.
  • 신뢰도 기반 가지치기 메커니즘을 적용하여 초평면 결정 영역에 기여하는 뉴런을 제거함으로써 트로이의 분류 표면을 제거한다.
  • 청결한 데이터 접근이나 모델 최적화가 필요 없이 표준 훈련 파이프라인에 통합되어 실시간 완화가 가능하다.
  • 오염된 샘플과 초평면 탐지 기반으로 평가되며, 다양한 모델(예: NiN, VGG16, ResNet18)과 공격 유형(예: BadNets, 레이블 일관성 공격)에서 악성 뉴런 식별에 있어 98% 이상의 정밀도와 재현율을 달성한다.

실험 결과

연구 질문

  • RQ1왜 명시적 데이터 오염 없이도 DNN가 백도어 트리거에 해당하는 초평면 결정 영역을 형성하는가?
  • RQ2왜 조각별 선형 활성화 함수가 입력 공간 내 이러한 초평면 영역의 형성에 기여하는가?
  • RQ3훈련 시점에서 이러한 초평면 영역을 탐지하고 제거할 수 있는 방어 기법을 설계할 수 있는가?
  • RQ4이러한 방어 기법이 데이터 필터링이나 후처리 분석에 의존하지 않고 주입 및 자연 발생 백도어 양쪽을 효과적으로 완화할 수 있는가?
  • RQ5페더레이티드 학습과 전이 학습을 포함한 다양한 훈련 환경에서 이 방어 기법은 어떻게 일반화되는가?

주요 결과

  • 표준 데이터 오염 공격 하에서 다섯 개의 데이터셋 전반에 걸쳐, NONE은 방어되지 않은 모델 대비 공격 성공률(ASR)을 54.83× 감소시킨다.
  • 자연적 백도어 상황에서는 NONE이 방어되지 않은 모델 대비 ASR을 1.75× 감소시켜 의도하지 않은 트로이 악성 코드에 대한 효과성을 입증한다.
  • 다양한 모델(NiN, VGG16, ResNet18)과 공격 유형(예: BadNets, 레이블 일관성 공격)에서 오염된 샘플 식별에 대해 98% 이상의 정밀도와 재현율을 달성한다.
  • 10명의 참가자(중 4명 악성)가 있는 페더레이티드 학습 환경에서, NONE은 ASR을 31.16× 감소시키며 MNIST에서는 98.60%의 테스트 정확도, CIFAR-10에서는 78.67%의 정확도를 유지한다.
  • 전이 학습 환경에서는 방어되지 않은 모델 대비 정확도가 뿐만 아니라 2.00% 이하로 낮아도 ASR이 4.00%로 감소하며 높은 정확도를 유지한다.
  • 점진적으로 데이터를 오염시키는 적응형 공격에 대해서도 효과적이며, 이는 구조적 원인(초평면 형성)을 타겟으로 하기 때문이다. 따라서 훈련 중 행동적 차이에 의존하지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.