Skip to main content
QUICK REVIEW

[논문 리뷰] Backdoor Federated Learning by Poisoning Backdoor-Critical Layers

Haomin Zhuang, Mingxian Yu|arXiv (Cornell University)|2023. 08. 08.
Adversarial Robustness in Machine Learning인용 수 4
한 줄 요약

이 논문은 페더레이티드 러닝에서 백도어 공격을 위해 배경에 중요한(Bac) 레이어—백도어 공격에 가장 취약한 주요 모델 레이어—를 특정하는 데에 레이어 교체 분석을 사용하는 새로운 백도어 공격을 제안한다. 오직 10%의 클라이언트만 악성으로 악용함으로써 이 비critical 레이어들만 오염시킴으로써, 높은 백도어 성공률을 달성하면서도 일곱 가지 최신 방어 기법을 우회하며, 기존 공격들보다 훨씬 더 은밀하고 효과적인 성능을 발휘한다.

ABSTRACT

Federated learning (FL) has been widely deployed to enable machine learning training on sensitive data across distributed devices. However, the decentralized learning paradigm and heterogeneity of FL further extend the attack surface for backdoor attacks. Existing FL attack and defense methodologies typically focus on the whole model. None of them recognizes the existence of backdoor-critical (BC) layers-a small subset of layers that dominate the model vulnerabilities. Attacking the BC layers achieves equivalent effects as attacking the whole model but at a far smaller chance of being detected by state-of-the-art (SOTA) defenses. This paper proposes a general in-situ approach that identifies and verifies BC layers from the perspective of attackers. Based on the identified BC layers, we carefully craft a new backdoor attack methodology that adaptively seeks a fundamental balance between attacking effects and stealthiness under various defense strategies. Extensive experiments show that our BC layer-aware backdoor attacks can successfully backdoor FL under seven SOTA defenses with only 10% malicious clients and outperform the latest backdoor attack methods.

연구 동기 및 목표

  • 페더레이티드 러닝에서 백도어 공격에 가장 취약한 주요 모델 레이어인 백도어-핵심(BC) 레이어의 존재를 규명하고 검증하는 것.
  • 공격자가 모델 아키텍처나 학습 데이터에 대한 사전 지식 없이도, 전방 및 후방 레이어 교체를 통해 BC 레이어를 식별할 수 있는 일반적인 현장 내 분석 방법을 개발하는 것.
  • BC 레이어에 집중하여 최대한의 은밀성과 효과를 발휘하는 두 가지 새로운 백도어 공격 기법—레이어별 오염 공격(LP 공격)과 레이어별 뒤집기 공격(LF 공격)—을 설계하는 것.
  • 다양한 방어 전략 하에서 제안된 공격의 성능을 평가하여, 백도어 성공률과 주 작업 정확도 측면에서 뛰어난 성능을 보여주는 것.
  • BC 레이어가 컨볼루션 네트워크(CNNs)와 BERT, LSTM 등 다양한 아키텍처에서 존재함을 보여주는 것.

제안 방법

  • 레이어 교체 분석을 제안: 정상 모델과 악성 모델 간의 레이어를 반복적으로 교체하여 백도어 성공률의 변화에 기반해 BC 레이어를 식별하는 기법.
  • 전방 교체(악성 레이어를 정상 모델에 삽입)와 후방 교체(정상 레이어를 악성 모델에 삽입)를 사용하여 핵심 레이어를 고립시키는 방식.
  • 식별된 BC 레이어에만 집중하여 최소한의 가중치 수정으로 공격하는 LP 공격(Layer-wise Poisoning)과 LF 공격(Layer-wise Flipping)을 설계.
  • 거리 기반, 역행 기반, 부호 기반 방어 기법에 대비해 탐지 위험을 최소화하면서도 공격의 효과성과 은밀성을 균형 잡는 전략을 적용.
  • CIFAR-10, SVHN, SST-2, Reddit 등의 다양한 데이터셋과 CNNs, ResNet18, VGG19, BERT, DistilBERT, LSTM 등의 여러 모델에 이 방법을 적용.
  • 실제 페더레이티드 러닝 위협 모델을 반영하기 위해 오직 10%의 클라이언트만 악성으로 설정하는 클라이언트 수준의 오염 전략을 적용.

실험 결과

연구 질문

  • RQ1페더레이티드 러닝에서 백도어 공격에 가장 취약한 특정 모델 레이어—백도어-핵심(BC) 레이어—가 존재하는가?
  • RQ2모델 아키텍처나 학습 데이터에 대한 사전 지식 없이도 현장 내 레이어 교체 기법을 통해 BC 레이어를 신뢰성 있게 식별할 수 있는가?
  • RQ3모든 모델 레이어가 아닌 BC 레이어에만 집중함으로써 백도어 공격의 은밀성과 효과성을 크게 향상시킬 수 있는가?
  • RQ4제안된 레이어별 공격 기법은 페더레이티드 러닝에서 일곱 가지 최신 방어 기법 하에서 어떻게 성능을 발휘하는가?
  • RQ5BC 레이어는 컴퓨터 비전 및 자연어 처리 모델 모두에 존재하며 식별 가능한가?

주요 결과

  • 백도어-핵심 레이어는 존재하며, 거의 모든 백도어 성공률를 담당한다. 단 한 개의 BC 레이어(예: fc1.weight)만 제거해도 백도어 성공률가 거의 0에 수렴한다.
  • 제안된 레이어 교체 분석 기법은 ResNet18, VGG19, BERT, 2층 LSTM 등 다양한 모델에서 BC 레이어를 성공적으로 식별하였다.
  • LP 및 LF 공격는 평가된 모든 방어 기법 하에서 오직 10%의 악성 클라이언트만으로도 100%의 백도어 성공률를 달성하며, 기존 공격 기법인 DBA를 능가한다.
  • 공격는 깨끗한 데이터에 대해 높은 주 작업 정확도(>95%)를 유지하여 모델의 유용성에 거의 영향을 주지 않았다.
  • 자연어 처리(NLP) 모델에서는 BC 레이어가 주로 어텐션 메커니즘 행렬(Q, K, V)과 출력 선형 레이어에 위치해 있으며, BERT 및 DistilBERT의 최종 분류기 레이어에는 해당되지 않는다.
  • NLP 모델에서 BC 레이어의 비율은 총 레이어 수의 25% 미만으로 나타나, 그 희소성과 전략적 중요성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.