Skip to main content
QUICK REVIEW

[논문 리뷰] Efficient Backdoor Attacks for Deep Neural Networks in Real-world Scenarios

Ziqiang Li, Sun Hong|arXiv (Cornell University)|2023. 06. 14.
Adversarial Robustness in Machine Learning인용 수 6
한 줄 요약

이 논문은 공격자가 전체 훈련 데이터에 접근할 수 없는 데이터 제약 조건 상황을 고려하여, 클린 특징 억압(Clean Feature Suppression)과 오염 특징 증강(Poisoning Feature Augmentation)을 활용해 공격 성공률를 향상시키는 새로운 CLIP 기반 뒷통로 공격 프레임워크를 제안한다. 이 방법은 현실적인 다중 소스 데이터 수집 환경에서 기존 방법 대비 공격 성공률가 100% 이상 향상된다.

ABSTRACT

Recent deep neural networks (DNNs) have came to rely on vast amounts of training data, providing an opportunity for malicious attackers to exploit and contaminate the data to carry out backdoor attacks. However, existing backdoor attack methods make unrealistic assumptions, assuming that all training data comes from a single source and that attackers have full access to the training data. In this paper, we introduce a more realistic attack scenario where victims collect data from multiple sources, and attackers cannot access the complete training data. We refer to this scenario as data-constrained backdoor attacks. In such cases, previous attack methods suffer from severe efficiency degradation due to the entanglement between benign and poisoning features during the backdoor injection process. To tackle this problem, we introduce three CLIP-based technologies from two distinct streams: Clean Feature Suppression and Poisoning Feature Augmentation.effective solution for data-constrained backdoor attacks. The results demonstrate remarkable improvements, with some settings achieving over 100% improvement compared to existing attacks in data-constrained scenarios. Code is available at https://github.com/sunh1113/Efficient-backdoor-attacks-for-deep-neural-networks-in-real-world-scenarios

연구 동기 및 목표

  • 실제 다중 소스 데이터 수집 환경에서 전체 훈련 데이터에 접근 가능하다는 가정을 하는 기존 뒷통로 공격의 격차를 보완한다.
  • 데이터 제약 조건 상황에서 오염 데이터 분포가 훈련 데이터 분포와 다를 경우 기존 방법의 성능 저하 문제를 해결한다.
  • 공격자가 일부 데이터 소스만 제어할 수 있는 상황에서도 효율적이고 은밀한 뒷통로 공격을 개발한다.
  • 실제 구현 환경에서 양호한 정상 정확도를 유지하면서 탐지 가능성 최소화와 함께 높은 공격 성공률를 확보한다.

제안 방법

  • 사전 훈련된 CLIP 모델을 활용해 클린 데이터 및 오염 데이터의 특징 표현을 추출하고 조작한다.
  • 클린 특징 억압(CLIP-UAP)를 도입하여 정상 특징의 영향을 감소시켜 오염 특징이 더 두드러지게 하도록 한다.
  • 오염 특징 증강(Poisoning Feature Augmentation, CLIP-CFA)을 적용하여 뒷통로 트리거가 유도하는 특징의 표현력과 영향력을 강화한다.
  • 추가로 대비 특징 강화(Contrastive Feature Enhancement, CLIP-CFE)를 통합하여 오염 특징의 정렬성과 독창성을 더욱 강화한다.
  • 수량 제약, 클래스 제약, 도메인 제약과 같은 세 가지 데이터 제약 조건 상황에 맞는 공격 파이프라인을 설계한다.
  • CLIP의 시각-언어 정렬 기능을 활용해 다양한 데이터셋과 타겟 모델 간 이식성과 강건성을 향상시킨다.
(a) O2O Data Collection Mode
(a) O2O Data Collection Mode

실험 결과

연구 질문

  • RQ1공격자가 전체 훈련 데이터에 접근할 수 없는 데이터 제약 조건 상황에서 뒷통로 공격의 성공률는 어떻게 저하되는가?
  • RQ2오염 데이터가 제한적이고 분포가 다를 경우 CLIP 기반 특징 조작 기법이 뒷통로 공격의 효과성을 향상시킬 수 있는가?
  • RQ3클린 특징 억압와 오염 특징 증강이 정상 정확도를 유지하면서 공격 성공률를 얼마나 향상시키는가?
  • RQ4제안된 방법은 다양한 사전 훈련된 CLIP 모델과 타겟 아키텍처에서 얼마나 강건한가?
  • RQ5제안된 프레임워크는 클린 레이블 공격이나 도메인 제약 공격과 같은 다른 뒷통로 공격 상황으로 일반화될 수 있는가?

주요 결과

  • 제안된 CLIP 기반 방법은 데이터 제약 조건 상황에서 기준 방법인 BadNets와 Blended 대비 공격 성공률가 100% 이상 향상된다.
  • 클린 특징 억압(CLIP-UAP)와 오염 특징 증강(CLIP-CFA)는 특히 클래스 제약 및 도메인 제약 상황에서 공격 효과성을 크게 향상시킨다.
  • CLIP-CFE 통합으로 모든 트리거 유형과 설정에서 공격 성공률가 추가로 향상되어 강력한 특징 수준의 오염 능력을 입증한다.
  • 모든 평가 설정에서 높은 정상 정확도를 유지하여 은밀성과 실용적 타당성을 확인한다.
  • 여러 CLIP 변형에서 뛰어난 성능을 보이며, ViT-B/32가 특히 효과적인 백본으로 나타났다.
  • 절단 분석 결과, CLIP-UAP와 CLIP-CFA는 독립적으로나 상호 보완적으로 공격 성능 향상에 기여하며, 특히 낮은 오염 비율과 높은 도메인 불일치 조건에서 두드러진다.
(b) M2O Data Collection Mode
(b) M2O Data Collection Mode

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.