Skip to main content
QUICK REVIEW

[논문 리뷰] Enhancing Clean Label Backdoor Attack with Two-phase Specific Triggers

Nan Luo, Yuanzhang Li|arXiv (Cornell University)|2022. 06. 10.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 U-Net 오토인코더를 사용하여 청소년 레이블 백도어 공격의 성능을 향상시키기 위해 이미지별 트리거 생성 방법을 이중 단계로 제안한다. 목표 이미지, 비목표 이미지 및 지각적 손실을 조합한 손실 함수를 사용하여 트리거 생성기를 훈련시킴으로써, 5% 오염 비율에서 98.98%의 공격 성공률를 달성하면서도 높은 은폐성과 방어 수단에 대한 저항성을 확보한다.

ABSTRACT

Backdoor attacks threaten Deep Neural Networks (DNNs). Towards stealthiness, researchers propose clean-label backdoor attacks, which require the adversaries not to alter the labels of the poisoned training datasets. Clean-label settings make the attack more stealthy due to the correct image-label pairs, but some problems still exist: first, traditional methods for poisoning training data are ineffective; second, traditional triggers are not stealthy which are still perceptible. To solve these problems, we propose a two-phase and image-specific triggers generation method to enhance clean-label backdoor attacks. Our methods are (1) powerful: our triggers can both promote the two phases (i.e., the backdoor implantation and activation phase) in backdoor attacks simultaneously; (2) stealthy: our triggers are generated from each image. They are image-specific instead of fixed triggers. Extensive experiments demonstrate that our approach can achieve a fantastic attack success rate~(98.98%) with low poisoning rate~(5%), high stealthiness under many evaluation metrics and is resistant to backdoor defense methods.

연구 동기 및 목표

  • 기존의 청소년 레이블 백도어 공격의 한계를 해결하기 위해, 고해상도 데이터셋에서 실패하는 고정형 트리거를 사용하는 방식을 개선한다.
  • 백도어 임플란테이션 및 활성화 단계를 동시에 향상시켜 공격 효과성을 높인다.
  • 고정 패턴 대신 이미지별 트리거를 생성하여 은폐성을 높인다.
  • 일반적인 방어 수단인 데이터 증강 및 STRIP에 대한 저항성을 확보한다.
  • 최소한의 오염 비율로 높은 공격 성공률를 달성하고, 정상 데이터에 대한 정확도 저하를 극히 미미하게 유지한다.

제안 방법

  • 목표 이미지에서 입력 이미지를 기반으로 이미지별 트리거를 생성하기 위해 맞춤형 손실 함수를 사용하는 U-Net 오토인코더를 훈련시킨다.
  • 효과성과 은폐성을 균형 있게 유지하기 위해 목표 이미지 손실, 비목표 이미지 손실 및 지각적 손실을 조합한 다중 구성 요소 손실 함수를 설계한다.
  • 사전 훈련된 트리거 생성기를 사용하여 백도어 임플란테이션 단계에서 오염된 훈련 데이터를 생성한다.
  • 추론 중 백도어 활성화 단계에서 동일한 트리거 생성기를 사용하여 악성 입력을 제작한다.
  • 은폐성과 공격 성공률를 균형 잡기 위해 다양한 $l_{ infty}$ 제약 조건 하에서 트리거 생성을 최적화한다.
  • 데이터 증강 및 STRIP 방어에 대한 강건성을 평가하기 위해 정상 모델과 오염된 모델에서 FR 및 ASR을 측정한다.

실험 결과

연구 질문

  • RQ1이미지별 트리거는 고해상도 데이터셋에서 청소년 레이블 백도어 공격의 성공률를 향상시키는 데 효과적인가?
  • RQ2이미지별 트리거는 백도어 임플란테이션 및 활성화 단계를 얼마나 효과적으로 촉진하는가?
  • RQ3고정 트리거에 비해 이미지별 트리거는 은폐성 향상에 얼마나 기여하는가?
  • RQ4제안된 트리거는 데이터 증강 및 STRIP과 같은 일반적인 방어 수단에 얼마나 저항성이 있는가?
  • RQ5제안된 방법에서 트리거 강도($l_{ infty}$)와 은폐성 사이의 상호 교환 관계는 어떠한가?

주요 결과

  • 제안된 방법은 오직 5%의 오염 비율에서도 98.98%의 공격 성공률를 달성하여 이전의 청소년 레이블 공격을 크게 능가한다.
  • 이 방법은 정상 정확도 97.98%를 유지하며, 정상 모델 대비 0.34%의 정확도 저하를 보이며 성능 저하가 극히 미미하다.
  • $l_{ infty} = 15/255$일 때, 공격 성공률는 85.47%에 달하지만 은폐성은 유지되며, 데이터 증강 조건에서도 ASR가 0.0214% 뿐만 감소한다.
  • STRIP 방어에 대해 저항성이 있으며, 오염된 이미지의 엔트로피 분포가 정상 이미지와 유사하여 높은 은폐성을 나타낸다.
  • 데이터 증강 조건에서도 공격은 효과적이며, ASR는 2.14% 감소에 그치지만, CLBA는 4.49% 감소하고 GTRBA는 22.04% 증가한다.
  • 트리거 생성기가 백도어 임플란테이션을 효과적으로 촉진함을 증명하기 위해, 동일한 $l_{ infty}$ 제약 조건 하에서 오염된 모델의 FR 및 ASR가 정상 모델보다 높게 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.