Skip to main content
QUICK REVIEW

[논문 리뷰] HaS-Nets: A Heal and Select Mechanism to Defend DNNs Against Backdoor Attacks for Data Collection Scenarios

Hassan Ali, ‪Surya Nepal‬|arXiv (Cornell University)|2020. 12. 14.
Adversarial Robustness in Machine Learning참고 문헌 17인용 수 14
한 줄 요약

이 논문은 데이터 수집 환경에서 백도어 공격에 대응하기 위해 치유와 선택적 재학습을 융합한 새로운 방어 메커니즘인 HaS-Nets를 제안한다. 반복적으로 소량의 신뢰할 수 있는 치유 데이터셋(전체 데이터의 2–15%)을 사용해 모델을 치유하고, 일관성 없는 학습 샘플을 걸러내는 방식으로, 다양한 데이터셋과 아키텍처에서 공격 성공률을 90% 이상에서 15% 이하로 감소시킨다. 이는 여러 공격 변종에 대비해 최신 기술을 초월하는 성능을 보인다.

ABSTRACT

We have witnessed the continuing arms race between backdoor attacks and the corresponding defense strategies on Deep Neural Networks (DNNs). Most state-of-the-art defenses rely on the statistical sanitization of the "inputs" or "latent DNN representations" to capture trojan behaviour. In this paper, we first challenge the robustness of such recently reported defenses by introducing a novel variant of targeted backdoor attack, called "low-confidence backdoor attack". We also propose a novel defense technique, called "HaS-Nets". "Low-confidence backdoor attack" exploits the confidence labels assigned to poisoned training samples by giving low values to hide their presence from the defender, both during training and inference. We evaluate the attack against four state-of-the-art defense methods, viz., STRIP, Gradient-Shaping, Februus and ULP-defense, and achieve Attack Success Rate (ASR) of 99%, 63.73%, 91.2% and 80%, respectively. We next present "HaS-Nets" to resist backdoor insertion in the network during training, using a reasonably small healing dataset, approximately 2% to 15% of full training data, to heal the network at each iteration. We evaluate it for different datasets - Fashion-MNIST, CIFAR-10, Consumer Complaint and Urban Sound - and network architectures - MLPs, 2D-CNNs, 1D-CNNs. Our experiments show that "HaS-Nets" can decrease ASRs from over 90% to less than 15%, independent of the dataset, attack configuration and network architecture.

연구 동기 및 목표

  • 기존의 백도어 방어 기법의 강건성을 시험하기 위해 통계 정제 기반 방어를 회피하는 새로운 저신뢰도 백도어 공격을 제안한다.
  • 기존 방어 기법이 대량의 정상 데이터가 필요로 하는 한계를 해결하기 위해, 전체 학습 세트의 2–15%만으로도 효과적인 방법을 제안한다.
  • 다양한 백도어 공격 변종(예: 투명한 공격, 레이블 일관성 공격 등)에 강건한 일반화된, 아키텍처 독립적인 방어 메커니즘을 개발한다.
  • 모든 학습 데이터가 오염된 상태(모든 트로이 악성코드 공격)와 같은 극한 조건에서도 방어 성능을 평가하여 확장성과 강건성을 입증한다.

제안 방법

  • 일반화된 레이블 대신 분포 레이블(예: [0.2, 0.4, 0.2, 0.2])을 사용해 독성 기울기의 크기를 줄이고 통계 감지기에서 숨기는 저신뢰도 백도어 공격을 제안한다.
  • 두 가지 공격 변종을 도입한다: 통계적 특징 기반 방어를 회피하기 위한 $\epsilon$-공격, 그리고 히트맵 기반 감지(예: Februus)를 회피하기 위해 이중 트리거와 유니온 트리거를 사용하는 $\epsilon^2$-공격.
  • 다중 순환 전방 계산에서 예측이 일관되지 않은 샘플을 걸러내는 방식으로 반복적으로 DNN을 재학습하는 '치유-선택' 메커니즘인 HaS-Nets를 개발한다.
  • 일관성 기반 선택 기준을 적용: 다중 전방 계산에서 예측 분산이 큰 샘플은 오염된 것으로 간주하고 제거한다.
  • 학습 중에 반복적으로 치유 과정을 적용하여 점진적으로 오염된 샘플을 제거하고, 모델의 정확도와 강건성을 복원한다.
  • 작은 치유 데이터셋(전체 데이터의 2–15%)을 사용해 치유 과정을 이끌어내어 실세계 데이터 수집 환경에서 실용적인 방법이 되도록 한다.

실험 결과

연구 질문

  • RQ1분포 레이블을 사용하는 저신뢰도 백도어 공격가 통계적 및 기울기 기반 방어를 회피할 수 있는가?
  • RQ2이중 트리거와 유니온 트리거를 사용하는 $\epsilon^2$-공격는 Februus와 같은 히트맵 기반 방어를 성공적으로 회피할 수 있는가?
  • RQ3소량의 정상 치유 데이터만 존재할 경우 HaS-Nets가 백도어 공격에 효과적으로 대응할 수 있는가?
  • RQ4비가시적 백도어 공격(비가시적 노이즈를 트리거로 사용)에 대해 HaS-Nets는 얼마나 강건한가?
  • RQ5레이블를 변경하지 않고 잠재 표현을 조작하는 레이블 일관성 공격에 대해 HaS-Nets는 저항성이 있는가?

주요 결과

  • $\epsilon$-공격는 STRIP에 대해 공격 성공률(ASR) 99%, Gradient-Shaping에 대해 63.73%, ULP-defense에 대해 91.2%, Februus에 대해 80%를 기록하여 기존 방어 기법의 취약성을 입증했다.
  • $\epsilon^2$-공격는 이중 트리거 메커니즘을 활용해 히트맵에서 두 번째 트리거를 숨기면서 Februus를 성공적으로 회피했고, ASR가 80% 이상을 기록했다.
  • HaS-Nets는 평가된 모든 데이터셋(Fashion-MNIST, CIFAR-10, Consumer Complaint, Urban Sound)과 네트워크 아키텍처(MLP, 2D-CNN, 1D-CNN)에서 공격 성공률을 90% 이상에서 15% 이하로 감소시켰다.
  • 비가시적 백도어 공격의 경우, 방어되지 않은 모델에서 ASR가 90% 이상이었으나 HaS-Nets는 이를 12% 이하로 낮춰 비가시 트리거에 대한 강력한 저항성을 보였다.
  • 레이블 일관성 공격의 경우, $\epsilon=1.0$일 때 Fashion-MNIST에서 ASR 11%, CIFAR-10에서 12%로 감소시켰고, $\epsilon=0.4$일 땐 백도어 삽입을 완전히 방지했다.
  • 모든 트로이 악성코드 공격(학습 데이터의 100%가 오염된 상태)에서도 HaS-Nets는 높은 테스트 정확도와 낮은 ASR를 유지하여 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.