Skip to main content
QUICK REVIEW

[논문 리뷰] Narcissus: A Practical Clean-Label Backdoor Attack with Limited Information

Yi Zeng, Minzhou Pan|arXiv (Cornell University)|2022. 04. 11.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

Narcissus는 전체 훈련 세트가 아닌 대상 클래스의 대표 예시만 필요로 하는 실용적이고 모델에 종속되지 않는 클린 레이블 백도어 공격을 제안한다. 랜덤한 증강과 전환에 대한 기대값(Expectation Over Transformation, EOT)을 사용해 지속 가능한 트리거 유사 패턴을 합성함으로써, 독자적인 환경 조건과 최신 방어 기법에도 불구하고 독자적인 환경 조건과 최신 방어 기법에도 불구하고 0.05%의 오염 비율로도 기존 클린 레이블 공격 대비 30.33배에서 64.45배 높은 성공률을 달성한다.

ABSTRACT

Backdoor attacks insert malicious data into a training set so that, during inference time, it misclassifies inputs that have been patched with a backdoor trigger as the malware specified label. For backdoor attacks to bypass human inspection, it is essential that the injected data appear to be correctly labeled. The attacks with such property are often referred to as "clean-label attacks." Existing clean-label backdoor attacks require knowledge of the entire training set to be effective. Obtaining such knowledge is difficult or impossible because training data are often gathered from multiple sources (e.g., face images from different users). It remains a question whether backdoor attacks still present a real threat. This paper provides an affirmative answer to this question by designing an algorithm to mount clean-label backdoor attacks based only on the knowledge of representative examples from the target class. With poisoning equal to or less than 0.5% of the target-class data and 0.05% of the training set, we can train a model to classify test examples from arbitrary classes into the target class when the examples are patched with a backdoor trigger. Our attack works well across datasets and models, even when the trigger presents in the physical world. We explore the space of defenses and find that, surprisingly, our attack can evade the latest state-of-the-art defenses in their vanilla form, or after a simple twist, we can adapt to the downstream defenses. We study the cause of the intriguing effectiveness and find that because the trigger synthesized by our attack contains features as persistent as the original semantic features of the target class, any attempt to remove such triggers would inevitably hurt the model accuracy first.

연구 동기 및 목표

  • 실제 분산 데이터 수집 환경에서는 흔히 구현이 어려운 전체 훈련 데이터 접근이 요구되는 기존 클린 레이블 백도어 공격의 격차를 해소한다.
  • 모델의 정확도를 유지하면서도 높은 공격 성공률을 확보하는 실용적인 백도어 공격을 설계한다.
  • 실제 물체에 트리거를 적용하는 물리적 환경에서의 공격에 대한 강건성을 확보한다.
  • 최신 방어 기법에 대한 공격의 효과성을 평가하여 그 한계를 드러낸다.
  • 최소한의 지식—즉, 대상 클래스의 대표 예시만으로도 매우 효과적인 백도어 공격을 수행할 수 있음을 입증한다.

제안 방법

  • 랜덤한 공간 패딩(최대 64×64 크기)과 제로 패딩을 적용하여 일관되며 작고 위치가 다양하게 설정된 트리거를 합성한다.
  • 랜덤 톤 색조 이동(±0.3 스케일)과 랜덤 회전을 적용해 환경 변화에 대한 강건성을 높인다.
  • 전환에 대한 기대값(Expectation Over Transformation, EOT) 기법을 사용해 랜덤 증강에 일반화되는 단일 강건한 트리거를 생성한다.
  • 오직 대상 클래스 데이터의 0.05%만 트리거가 부착된 예시로 교체된 오염된 데이터셋에서 모델을 훈련시킨다(예: Tiny-ImageNet에서 '개구리' 클래스).
  • 트리거가 대상 클래스와 의미적으로 일치하도록 하여 오염된 데이터가 자연스럽게 레이블링된 것처럼 보이게 함으로써, 정상 입력에 대한 모델 정확도를 유지한다.
  • 합성된 트리거가 대상 클래스와 유사한 지속 가능한 특징을 포함하고 있기 때문에, 제거 시 모델 성능에 악영향을 미치게 된다.

실험 결과

연구 질문

  • RQ1공격자가 다른 클래스의 지식 없이 대상 클래스의 대표 예시만을 가질 경우, 클린 레이블 백도어 공격이 효과적으로 작동할 수 있는가?
  • RQ2제안된 트리거 합성 기법이 매우 낮은 오염 비율(예: 0.05%)에서도 높은 공격 성공률을 달성하는 데 얼마나 효과적인가?
  • RQ3조명, 각도, 위치가 변하는 물리적 환경에서 합성된 트리거가 높은 강건성을 유지할 수 있는가?
  • RQ4최신 방어 기법이 정상 데이터에 대한 모델 정확도를 떨어뜨리지 않고 트리거를 탐지하거나 제거할 수 있는 정도는 어느 정도인가?
  • RQ5왜 방어 기법이 백도어 패턴을 제거하려고 해도 Narcissus 트리거는 특히 제거하기 어려운가?

주요 결과

  • Narcissus는 전체 훈련 데이터 접근이 필요한 기존 클린 레이블 공격(예: LC, HTBA, SAA) 대비 30.33배에서 64.45배 높은 공격 성공률를 달성한다.
  • 트리거가 없는 표준 테스트 세트에서 모델 정확도가 청소년 훈련 수준을 유지하여, 모델이 신뢰할 수 있는 것처럼 보이게 한다.
  • 물리적 환경 평가에서, 오직 Narcissus 트리거가 부착된 모델만 트리거가 있는 테스트 입력을 잘못 분류하는 데 성공했으며, 흰색 사각형 및 무작위 노이즈 트리거는 실패했다.
  • 모델은 테스트된 최신 방어 기법의 원형 형태에서 모두 회피했고, 수정된 방어 기법 버전에도 적응하여 우회할 수 있었다.
  • 트리거의 지속성—대상 클래스와의 의미적 유사성 덕분에—모든 제거 시도가 정상 정확도를 떨어뜨리므로, 제거가 본질적으로 어렵다.
  • 이 방법은 ResNet-18을 사용한 Tiny-ImageNet을 포함한 다양한 데이터셋과 모델에서 강력한 일반화 능력을 보이며, 디지털 및 물리적 트리거 조건 모두에서 효과를 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.